Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15

PR 列表

更多筛选
2026-07-05
功能 重要性 6.73 洞察度 5.00

移除 SP 必须依赖 DP 的限制,提升 MoE 吞吐 1.9%-5%

建议关注并行配置的相关变更,特别是 DP=1 时启用 SP 的新能力。对于使用 MoE 且未开启 DP 的用户,推荐尝试本 PR 以获取性能提升。同时注意 LoRA 与 SP 的互斥约束。

缺陷修复 重要性 5.86 洞察度 3.00

修复 TurboQuant 的 KV cache dtype 为 auto 的问题

该 PR 值得快速合并,因为修复了明确的回归且风险极低。但建议后续添加单元测试,覆盖 `_reshape_kv_cache` 和 `_update_hybrid_attention_layout` 中 `TQFullAttentionSpec` 和 `AttentionSpec` 的 dtype 选择逻辑。

缺陷修复 重要性 7.78 洞察度 6.00

修复 FA4 后端 Gemma4 长上下文乱码

建议合入该 PR,它修复了 Gemma4 在 FA4 后端上的严重输出错误。推荐注意力后端开发者详细阅读 `_make_mm_prefix_mask_mod` 的修改,学习如何正确地将滑动窗口与自定义 mask_mod 结合,以及绝对位置计算在分块预填充中的关键作用。对于使用 mm_prefix 特性的模型维护者,可参考其滑动窗口 clamp 的设计。

缺陷修复 重要性 5.29 洞察度 3.00

修复批量聊天采样参数覆盖问题

这是一个小而关键的 bugfix,建议合并。代码变更量少(4 行增加值、4 行删除值),逻辑清晰,且已通过 E2E 测试验证。值得关注的设计决策是遵循了 '与 ChatCompletionRequest 保持一致' 的原则,避免了为批量接口单独维护一套默认值。

#47198 [Perf] Remove redundant op for GLM 5.2

原始 PR · 作者 yewentao256 · 合并时间 2026-07-05 01:25

性能优化 重要性 6.32 洞察度 4.00

消除 GLM 5.2 稀疏注意力中冗余算子

值得合并。改动小、无风险,且是 Issue #46654 性能优化工作中清除冗余算子的典型步骤。对维护者而言,这类零碎优化在长期可积累显著的端到端加速。

参与讨论