Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-22 00:42 同步状态:空闲 下次计划:2026-08-22 01:42
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-06-27
缺陷修复 重要性 8.68 洞察度 5.00

修复 Transformers 后端 FP8 MoE 的内存泄漏并清理样板代码

此 PR 值得仔细阅读,展示了如何通过集中化 EPLB 状态管理和清理样板代码来减少跨模型冗余。关注 MoE 架构的开发者应重点审查 transformers/moe.py 和 interfaces.py 的接口变化,确认与自定义模型的兼容性。

缺陷修复 重要性 5.21 洞察度 3.00

修复 ROCm MLA 预填充崩溃,传入 num_kv_splits 参数

该 PR 是应对上游 AITER 接口变更的适配修复,变更极小(+3 行注释 +1 行逻辑),但修复了一个阻断性 bug,值得立即合并和回传。建议回顾者重点关注参数位置是否正确,以及是否有其他未覆盖的 `mla_reduce_v1` 调用点。

缺陷修复 重要性 7.85 洞察度 5.50

为 HarmonyParser 添加 flush() 方法,调用 process_eos() 刷新并重置。

此 PR 值得技术负责人和 parser 模块维护者精读,特别是 `flush()` 中异常处理和惰性初始化的设计决策。它展示了如何在不破坏现有接口的前提下,为下游修复铺平道路。后续 PR #46102 将进一步完善 serving 层集成,建议关注。

重构 重要性 6.09 洞察度 5.00

移除混合模型 FA 块大小限制

建议精读。该 PR 虽然改动小(仅 17 行删除),但涉及混合模型注意力机制的核心限制移除,是清理历史技术债务的好例子。推荐关注:1) 如何通过系统性的修复(KVBlockZeroer)替代临时 workaround;2) 对 hetero TP PD disagg 场景的潜在影响需在后续测试中确认。

#46808 [GLM-5] Add DSV3.2/GLM5 to `vllm/models/`

原始 PR · 作者 WoosukKwon · 合并时间 2026-06-27 05:09

功能 重要性 9.18 洞察度 6.00

添加 DeepSeek V3.2/GLM-5 硬件特定模型实现

建议架构师和模型开发者精读 `attention.py` 中的 `DeepseekV32Indexer` 实现,理解稀疏注意力索引生成逻辑,以及 `model.py` 中的层间残差连接设计,为后续优化奠定基础。

#46851 [ROCm][CI] Fix rlhf_nccl.py on ROCm

原始 PR · 作者 charlifu · 合并时间 2026-06-27 04:41

缺陷修复 重要性 6.17 洞察度 4.00

修复 ROCm 上 RLHF 示例的 RCCL 运行时 bug

此 PR 是一次有针对性的 bug 修复,代码量小且逻辑清晰。值得关注的是其采用的临时方案设计——通过清除环境变量绕过后端 bug,而不是修改核心库。作为 ROCm 平台兼容性修复的示例,可供参考。

基础设施 重要性 3.69 洞察度 2.00

移除 AMD CI mi250 队列中 v1 sample+logits 测试

变更简单直接,无需精读。适合作为 CI 维护参考:当某个测试步骤不再需要时,及时清理以保持流水线高效。

参与讨论