Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 18:31 同步状态:空闲 下次计划:2026-08-20 19:31

PR 列表

更多筛选
2026-07-28
缺陷修复 重要性 7.54 洞察度 6.00

新增 Gemma4 MTP 验收率测试并修复 3 个 bug

建议所有使用 Gemma4 MTP 的开发者 review 此 PR,特别是采样位置修复部分。测试框架的泛化设计值得学习,可复用于未来新增的推测模型。

#49096 Fix Humming non-gated MoE

原始 PR · 作者 netanel-haber · 合并时间 2026-07-28 06:56

缺陷修复 重要性 6.74 洞察度 5.00

修复 Humming MoE 非门控专家形状假设

本 PR 值得精读,因为它展示了如何在已有的门控假设后端中安全地引入非门控支持,通过 `is_gated` 属性做条件分支,并配套形状契约测试确保正确性。对于 MoE 量化后端的开发者具有参考价值。

缺陷修复 重要性 9.00 洞察度 5.00

修复 MQA 在 TP>1 时 split 错误,新增 PackedQKVFuser

建议阅读本 PR 以了解 Transformers 后端的 fuser 设计模式,特别是 `PackedQKVFuser.match` 和 `update_forward` 中的 AST 重写技巧,以及基类重构的分层思路。对于维护或扩展现有 StackedFuser 子类的开发者,需关注 `RewriteFuser` 的 `fuse` 方法行为是否与预期一致。

修复 Quark GLM-5.2 加载与 ROCm 稀疏 MLA 元数据崩溃

值得精读。这是“共享 forward 重构遗漏后端同步”的典型修复,`supports_dense_mha_prefill` 能力标志模式可以迁移到其他能力检测场景;同时展示了多贡献者合并重复 PR、保留回归测试归属的协作流程。建议关注后续 ROCm aiter sparse MLA 的 dense-MHA prefill follow-up,以及 #49275 对 NVFP4 MTP 加载问题的补充修复。

#49912 [CI] Initialize DeepEP FP8 test weights

原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-28 05:29

缺陷修复 重要性 4.29 洞察度 3.00

修复 DeepEP FP8 测试权重依赖随机内容

无需精读,可直接合并。这是一个 CI 稳定性修复,设计简单,值得类似测试编写者借鉴(避免 `torch.empty` 依赖全量内容)。

重构 重要性 8.29 洞察度 6.00

重构 INT8 MoE 路径,集成 oracle 后端选择

这份 PR 是 oracle 重构系列的重要一环,适合以下角色精读: - **框架开发者**:学习如何在现有 MoE 方法中集成 oracle 选择机制,以及如何优雅处理重构中的行为保持要求。 - **ROCm 平台工程师**:了解如何为新硬件扩展量化方案支持(`_supports_quant_scheme`)。 - **QA & CI 负责**:参考 test_int8_moe_oracle.py 的测试设计原则(平台无关、仅测试选择逻辑不启动内核)。 - **架构师**:关注 static-activation INT8 路径的遗留问题及后续迁移计划。

重构 重要性 8.19 洞察度 4.00

删除 22 个文件中 519 行未使用代码

建议精读涉及的核心文件(如 `minimax_m3.py`、`radio.py`、`modelopt.py`)以了解仓库中废弃代码的典型模式,并作为后续清理工作的参考。

参与讨论