Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-07-28

#44513 [XPU] Add online fp8 quantization test

原始 PR · 作者 yma11 · 合并时间 2026-07-28 10:34

测试 重要性 5.58 洞察度 4.00

XPU 启用在线 FP8 量化测试

本 PR 作为 XPU 平台启用测试覆盖的参考样例,值得其他平台(如 CPU)借鉴其 `is_quant_method_supported` 的扩展模式。审查时重点关注 `supported_quantization` 列表的维护成本和测试跳过的条件是否清晰。

性能优化 重要性 3.66 洞察度 6.00

消除 DSv3.2 稀疏 MLA 解码热循环中的冗余 FillFunctor 启动

值得精读。本 PR 展示了一个典型的性能优化模式:消除冗余 GPU 内核启动。对于运行 DeepSeek 模型且使用 ROCm 的团队,此变更可直接带来吞吐提升。同时,review 中关于工作区管理的讨论(使用 `current_workspace_manager` 替代全局变量)是值得学习的架构实践。

缺陷修复 重要性 5.87 洞察度 4.00

PCP 强制启用 V2 Model Runner

此 PR 变更简洁且必要,建议合并。可精读 `vllm/config/vllm.py` 中的 `use_v2_model_runner` 属性和 `_validate_config` 方法,理解 PCP 与 V2 的绑定模式。后续可考虑为 PCP 相关配置添加更多测试覆盖。

缺陷修复 重要性 7.54 洞察度 6.00

新增 Gemma4 MTP 验收率测试并修复 3 个 bug

建议所有使用 Gemma4 MTP 的开发者 review 此 PR,特别是采样位置修复部分。测试框架的泛化设计值得学习,可复用于未来新增的推测模型。

#49096 Fix Humming non-gated MoE

原始 PR · 作者 netanel-haber · 合并时间 2026-07-28 06:56

缺陷修复 重要性 6.74 洞察度 5.00

修复 Humming MoE 非门控专家形状假设

本 PR 值得精读,因为它展示了如何在已有的门控假设后端中安全地引入非门控支持,通过 `is_gated` 属性做条件分支,并配套形状契约测试确保正确性。对于 MoE 量化后端的开发者具有参考价值。

参与讨论