FlashInfer MNNVL 后端支持量化融合
建议合并。PR 改动量小、目标明确,符合 vLLM 现有架构设计。值得关注的是 quant workspace 初始化重构中显式抛 ValueError 的设计决策——避免静默降级有助于用户快速定位配置问题。建议后续补一则硬件可用性测试(如标记为 `needs_hardware`),确保在新的 CI runner 上能验证 MNNVL 量化融合路径。
A high-throughput and memory-efficient inference and serving engine for LLMs
FlashInfer MNNVL 后端支持量化融合
建议合并。PR 改动量小、目标明确,符合 vLLM 现有架构设计。值得关注的是 quant workspace 初始化重构中显式抛 ValueError 的设计决策——避免静默降级有助于用户快速定位配置问题。建议后续补一则硬件可用性测试(如标记为 `needs_hardware`),确保在新的 CI runner 上能验证 MNNVL 量化融合路径。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-13 14:14
ROCM CI Rust 构建缓存优化,避免非 Rust 变更时重复编译
推荐 CI 和构建团队精读,特别是 Docker 多阶段缓存和内容哈希模式,可复用于其他高频编译模块。
修复 Qwen MTP 在 MoE SP 下的 token 损坏
建议精读本 PR,理解 `_all_gather_hidden_and_residual` 的修复模式。该模式可作为未来 PR #47006 类似变更影响 MTP 路径时的参考样板。同时建议为 MoE SP + MTP 组合添加自动化回归测试。
原始 PR · 作者 R3hankhan123 · 合并时间 2026-07-13 12:58
为 s390x 构建层级 NUMA 拓扑以优化 TP 性能
建议阅读此 PR 以了解如何为异构 CPU 架构适配 NUMA 感知的核绑定。特别值得关注的点:`cpu_resource_utils.py` 中通过 `numa_node` 字段复用现有分组机制的设计权衡,以及 `ompmultiprocessing.py` 中根据 CPU 列表直接派生拓扑域以绕开物理内存节点的思路。虽然缺少自动化测试,但核心逻辑以注释和 warning 记录了假设,整体改动清晰。
原始 PR · 作者 Yejing-Lai · 合并时间 2026-07-13 12:37
修复 EagleMiniCPM 单元测试 TypeError
建议审核者快速合并。该 PR 修复了一个明确的测试失败问题,改动量小(+11/-3),已被 @DarkLight1337 批准。后续可关注是否真的需要多模态支持(届时移除 `inputs_embeds` 处的 raise 即可)。
CPU 后端 GDN 模型 DFlash 投机解码支持
该 PR 的设计决策值得学习,尤其是通过宽 conv 缓存实现状态回滚、SSM 多槽索引以及 C++ kernel 的并行/串行拆分。建议阅读 `cpu_gdn_attention_core` 的分支逻辑和 spec kernel 的 clamp 处理。推荐精读。
在 ROCm 上禁用 CUDA graph 内存分析
该 PR 内容简洁,值得快速 review 和合入。对于理解 vllm 多平台适配中的条件检查和性能权衡(特别是 CUDA graph 内存分析在不同硬件平台上的行为差异)有参考价值。无需特别精读,但可作为平台差异化处理的案例。
原始 PR · 作者 Fangzhou-Ai · 合并时间 2026-07-13 11:53
ROCm 上保留 base-class all_gather 路径修复 decode 回归
值得合并。这是一个经过充分性能测试的针对性修复,修复了重要回归,风险极低。
参与讨论