ROCm CI Docker 构建步骤新增一次重试
此 PR 变更简单明确,无需特别关注,可作为 CI 稳定性改进的参考。
A high-throughput and memory-efficient inference and serving engine for LLMs
ROCm CI Docker 构建步骤新增一次重试
此 PR 变更简单明确,无需特别关注,可作为 CI 稳定性改进的参考。
原始 PR · 作者 avalliappan-nvidia · 合并时间 2026-07-16 03:09
修复 draft_model 方法 CUDA-graph 未初始化的问题
值得精读。该 PR 以极小的改动(+2 行)修复了一个隐蔽且影响巨大的性能问题,是典型的关键路径条件遗漏 bug。建议团队在类似条件判断处做一次系统性审计,确保所有推测解码方法都被覆盖。同时考虑为 draft_model 补充 CUDA-graph 相关的回归测试。
原始 PR · 作者 taneem-ibrahim · 合并时间 2026-07-16 02:24
统一文档化 pooling 配置解析优先级
值得阅读:该文档清晰地解释了 pooling 配置的优先级链,对于使用 vLLM 部署 pooling 模型的用户是重要的参考。
统一 vllm_xargs 类型支持列表值
变更简单清晰,但为保持 API 一致性值得合并。建议在合并后关注是否有用户反馈列表值处理异常。
原始 PR · 作者 giuseppegrossi · 合并时间 2026-07-16 00:55
修复 ROCm Triton W4A16 GPTQ qzeros 布局错误
适合精读,尤其是处理不同量化库(GPTQ vs Compressed-Tensors)之间的张量布局兼容性时。设计决策体现了对多种 checkpoints 格式的防御性编程,值得参考。
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-07-15 23:56
修复 ROCm CI base 镜像哈希计算与传递
该 PR 为 CI 稳定性修复,值得精读以了解 CI 镜像选型中的竞态问题及解决方案。关注其设计模式:通过多次计算并比对、显式失败代替静默默认值来提升确定性。
原始 PR · 作者 xiaohongchen1991 · 合并时间 2026-07-15 23:43
新增 Helion 内核基准测试脚本与惰性注册
本 PR 值得精读,尤其是 `benchmark_helion_kernels.py` 的设计:如何选择基准测试方法(triton.do_bench vs tritonbench 的 cudagraph 实现)、如何组织基线映射。惰性注册的模式也值得在类似场景复用。风险较低,建议合入后通知相关开发者检查自定义脚本是否需要显式调用 `import_all_kernels()`。
原始 PR · 作者 xiaohongchen1991 · 合并时间 2026-07-15 23:42
Helion 内核注册改为惰性模式
建议此 PR 值得精读,因为它提供了一个清晰的惰性注册模式,适合其他类似的自定义内核或插件系统参考。关键设计决策是将注册与包导入解耦,提高了启动速度和日志清晰度。
参与讨论