修复 NVFP4 MoE gated 中间维度对齐错误
该 PR 值得合并,修复逻辑清晰且数学上正确。建议精读理解 NVFP4 MoE 的权重对齐策略。
A high-throughput and memory-efficient inference and serving engine for LLMs
修复 NVFP4 MoE gated 中间维度对齐错误
该 PR 值得合并,修复逻辑清晰且数学上正确。建议精读理解 NVFP4 MoE 的权重对齐策略。
原始 PR · 作者 NickLucche · 合并时间 2026-07-16 05:04
新增 DSv4-Flash 可选精度测试并修复 GPU 分配 bug
该 PR 主要是 CI/测试改进,适合 CI 维护者关注。值得借鉴的是对 Bash 算术陷阱的修复,可作为多 GPU 测试脚本编写的注意事项。新增的可选测试为重要模型提供了回归保护。
修复 Blackwell 上 FlashInfer 非因果 draft attention 崩溃与验收率低问题
推荐精读此 PR,它揭示了 CUDA 图与 attention backend 交互的隐患,展示了如何在 vLLM 中正确协调两者。特别是 `attn_vllm_config` 属性和 `init_cudagraph_manager` 的模式值得借鉴。后续可将 FlashInfer prefill wrapper 的 CUDA 图模式正确集成,恢复全图加速。
ROCm CI Docker 构建步骤新增一次重试
此 PR 变更简单明确,无需特别关注,可作为 CI 稳定性改进的参考。
原始 PR · 作者 avalliappan-nvidia · 合并时间 2026-07-16 03:09
修复 draft_model 方法 CUDA-graph 未初始化的问题
值得精读。该 PR 以极小的改动(+2 行)修复了一个隐蔽且影响巨大的性能问题,是典型的关键路径条件遗漏 bug。建议团队在类似条件判断处做一次系统性审计,确保所有推测解码方法都被覆盖。同时考虑为 draft_model 补充 CUDA-graph 相关的回归测试。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-16 02:24
统一文档化 pooling 配置解析优先级
值得阅读:该文档清晰地解释了 pooling 配置的优先级链,对于使用 vLLM 部署 pooling 模型的用户是重要的参考。
统一 vllm_xargs 类型支持列表值
变更简单清晰,但为保持 API 一致性值得合并。建议在合并后关注是否有用户反馈列表值处理异常。
原始 PR · 作者 giuseppegrossi · 合并时间 2026-07-16 00:55
修复 ROCm Triton W4A16 GPTQ qzeros 布局错误
适合精读,尤其是处理不同量化库(GPTQ vs Compressed-Tensors)之间的张量布局兼容性时。设计决策体现了对多种 checkpoints 格式的防御性编程,值得参考。
参与讨论