Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-05
缺陷修复 重要性 6.41 洞察度 4.00

移除 feed_tokens 超时,修复 Voxtral 静默挂起

值得合并。修复逻辑清晰,改动极小,且经 E2E 测试验证。建议后续考虑为队列等待添加更长的超时或健康检查机制,但当前方案已满足需求。

功能 重要性 6.73 洞察度 5.00

移除 SP 必须依赖 DP 的限制,提升 MoE 吞吐 1.9%-5%

建议关注并行配置的相关变更,特别是 DP=1 时启用 SP 的新能力。对于使用 MoE 且未开启 DP 的用户,推荐尝试本 PR 以获取性能提升。同时注意 LoRA 与 SP 的互斥约束。

缺陷修复 重要性 5.86 洞察度 3.00

修复 TurboQuant 的 KV cache dtype 为 auto 的问题

该 PR 值得快速合并,因为修复了明确的回归且风险极低。但建议后续添加单元测试,覆盖 `_reshape_kv_cache` 和 `_update_hybrid_attention_layout` 中 `TQFullAttentionSpec` 和 `AttentionSpec` 的 dtype 选择逻辑。

缺陷修复 重要性 7.78 洞察度 6.00

修复 FA4 后端 Gemma4 长上下文乱码

建议合入该 PR,它修复了 Gemma4 在 FA4 后端上的严重输出错误。推荐注意力后端开发者详细阅读 `_make_mm_prefix_mask_mod` 的修改,学习如何正确地将滑动窗口与自定义 mask_mod 结合,以及绝对位置计算在分块预填充中的关键作用。对于使用 mm_prefix 特性的模型维护者,可参考其滑动窗口 clamp 的设计。

参与讨论