Prhub

vllm-project/vllm

A high-throughput and memory-efficient inference and serving engine for LLMs

监控状态:已开启 最近同步:2026-08-21 19:35 同步状态:空闲 下次计划:2026-08-21 20:35

PR 列表

更多筛选
2026-07-16
测试 重要性 4.80 洞察度 3.00

新增 DSv4-Flash 可选精度测试并修复 GPU 分配 bug

该 PR 主要是 CI/测试改进,适合 CI 维护者关注。值得借鉴的是对 Bash 算术陷阱的修复,可作为多 GPU 测试脚本编写的注意事项。新增的可选测试为重要模型提供了回归保护。

缺陷修复 重要性 8.30 洞察度 7.00

修复 Blackwell 上 FlashInfer 非因果 draft attention 崩溃与验收率低问题

推荐精读此 PR,它揭示了 CUDA 图与 attention backend 交互的隐患,展示了如何在 vLLM 中正确协调两者。特别是 `attn_vllm_config` 属性和 `init_cudagraph_manager` 的模式值得借鉴。后续可将 FlashInfer prefill wrapper 的 CUDA 图模式正确集成,恢复全图加速。

缺陷修复 重要性 5.66 洞察度 6.00

修复 draft_model 方法 CUDA-graph 未初始化的问题

值得精读。该 PR 以极小的改动(+2 行)修复了一个隐蔽且影响巨大的性能问题,是典型的关键路径条件遗漏 bug。建议团队在类似条件判断处做一次系统性审计,确保所有推测解码方法都被覆盖。同时考虑为 draft_model 补充 CUDA-graph 相关的回归测试。

文档 重要性 4.22 洞察度 4.00

统一文档化 pooling 配置解析优先级

值得阅读:该文档清晰地解释了 pooling 配置的优先级链,对于使用 vLLM 部署 pooling 模型的用户是重要的参考。

参与讨论