Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-17
功能 重要性 9.00 洞察度 6.00

为 Kimi-VL 添加 ViT 全 CUDA 图支持

值得精读。重点阅读 `moonvit.py` 中 `prepare_encoder_metadata` 的设计(如何将 grid 相关计算外提)以及 `kimi_vl.py` 中协议方法的实现,可作为其他视觉模型启用 ViT CUDA 图的参考蓝本。

性能优化 重要性 6.21 洞察度 6.00

MiniMax-M3 在 MI300X 上启用 fp8_per_channel 量化,提升吞吐 28%

建议合入。该 PR 解决了 MiniMax-M3 在 ROCm 上的性能瓶颈,改动量小且经过充分验证。后续应关注长上下文和更多任务的精度表现。设计上通过参数传递链的轻微调整即可修复精度 bug 并启用新量化,值得参考。

缺陷修复 重要性 5.69 洞察度 6.00

修复 ROCm GFX942 上稀疏 MLA 精度退化

该 PR 是关键的 bugfix,值得精读以理解 GPU 内存对齐问题如何影响模型精度。建议关注后续性能优化,重新考虑是否以及如何在保障精度的前提下恢复 C++ 内核。

缺陷修复 重要性 4.03 洞察度 3.00

修复 PPL 测试数据集 ID 兼容性问题

建议合并。这是针对上游库 API 变动的必要兼容性修复,改动极小且已验证正确性。值得关注的是这类依赖升级引发的测试失败模式,团队应建立定期检查测试依赖兼容性的机制。

修复Gemma4 post-tool推理泄露到content

值得精读,尤其关注:\n- 如何在不破坏现有流程的前提下引入状态调整钩子(通过标志 `_prompt_streaming_prepared` 保证只执行一次)。\n- 设计决策:复用 `is_reasoning_end` 避免重复扫描逻辑,no-op 过渡处理边界情况。\n- 命名哲学:`adjust_initial_state_from_prompt` 准确表达了意图。\n- 测试设计:同时覆盖回归用例和鲁棒性用例,以及确保新回合不受影响。

参与讨论