Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-20 17:15 同步状态:空闲 下次计划:2026-08-20 18:15
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-07-06
缺陷修复 重要性 6.91 洞察度 6.00

修复 MNNVL 工作区与 one-shot 选择不匹配

该 PR 值得精读,尤其是 `_select_flashinfer_allreduce_use_oneshot` 的设计体现了 backend 感知的策略委托模式,以及 `trigger_completion_at_end` 参数与 one-shot 的耦合关系。测试覆盖了关键的边界情况,包括 device_capability 为 None 时的回退。

缺陷修复 重要性 3.70 洞察度 4.00

修复 triton_decode_attention 中 int32 溢出导致 CUDA 非法内存访问

建议所有使用 vLLM v1 版 Triton 解码注意力的用户尽快合并此修复。该 PR 虽小,但解决了一个难排查的异步崩溃问题,值得关注。设计上采用与其他 kernel 一致的 int64 类型转换,是安全的防御性编程实践。

#47748 [CI] Skip test for checkpoint that was deleted

原始 PR · 作者 hmellor · 合并时间 2026-07-06 22:24

缺陷修复 重要性 3.88 洞察度 2.00

标记已删除的 checkpoint 为不可用

变更很小且直接,可以快速合并以恢复 CI。但建议未来考虑更健壮的 CI 策略,例如在 checkpoint 下载失败时自动降级或重试,而不是单个 checkpoint 问题阻塞整个 CI。

缺陷修复 重要性 6.31 洞察度 6.00

修复 async scheduling + spec decode 时 num_output_placeholders 下溢

此 PR 值得精读,因为它展示了异步调度与推测解码交互中的微妙边界情况,修复手法干净(增加一个守卫条件),并且测试充分(e2e 和单元测试)。对于理解 vLLM 调度器内部状态机有帮助,也体现了代码 review 中保留边缘情况测试的重要性。

#45813 [Doc] Clarify fastokens availability

原始 PR · 作者 LiJzd · 合并时间 2026-07-06 21:33

文档 重要性 1.61 洞察度 1.00

澄清 VLLM_USE_FASTOKENS 从 0.23.0 开始可用

建议合并以完善文档,解决用户困惑。此 PR 属于小范围文档修正,无需特别关注技术设计。

缺陷修复 重要性 6.89 洞察度 3.00

回退 torch.Event 改为 torch.cuda.Event 以修复 XPU 兼容性

该 PR 为紧急修复,应及时合并。值得关注的是 `DeepseekV4XPUAttention.__init__` 中使用的猴子补丁模式(临时替换 `torch.cuda.Event`),为后续多设备支持提供了参考。建议在 PyTorch 上游修复 `torch.Event` 后,再重新考虑统一迁移。

性能优化 重要性 8.80 洞察度 6.00

缓存 scheduler 和 request 级 metrics handles 以减少重复查找

值得精读,展示了 Rust 中通过预解析和缓存 metrics handles 来优化性能的实践模式。适合作为 Rust 后端性能优化和 caching 策略的参考。

参与讨论