#41573 [ROCm][CI] Stabilize ROCm shutdown and distributed compile CI
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-10 11:47
稳定 ROCm 关闭流程和分布式编译 CI
此 PR 是维护性修复,值得快速合并。对于 ROCm 开发者,建议关注关闭测试中的超时断言是否仍然导致不稳定,并可考虑采纳 `gemini-code-assist[bot]` 的建议加入缓冲。无需深入精读。
A high-throughput and memory-efficient inference and serving engine for LLMs
原始 PR · 作者 AndreasKaratzas · 合并时间 2026-05-10 11:47
稳定 ROCm 关闭流程和分布式编译 CI
此 PR 是维护性修复,值得快速合并。对于 ROCm 开发者,建议关注关闭测试中的超时断言是否仍然导致不稳定,并可考虑采纳 `gemini-code-assist[bot]` 的建议加入缓冲。无需深入精读。
修复 DSv4 topk 对未对齐 max-model-len 的数值问题
值得精读:这是一个典型的内存布局假设引发数值问题的小而精修复,展示了在 CUDA kernel 中正确处理 tensor stride 的重要性。
原始 PR · 作者 AbhiOnGithub · 合并时间 2026-05-10 11:08
澄清 Gemma 4 辅助模型须用 MTP 路径
建议精读。该 PR 是处理“文档与实现不一致”的标准范例,值得其他特性维护者参考。
KV cache 批量交换使用 ACCESS_ORDER_ANY 提升带宽
值得精读,特别是关于 CUDA DMA ordering 的讨论和细粒度性能优化的实践。设计决策(何时放松 ordering、何时保留)可作为类似场景的参考。
泛化 CLI 可选布尔/字符串参数处理
值得精读。该 PR 虽小,但展示了一个很好的代码去特化(despecialization)模式:将散落的局部处理逻辑统一收拢到基础设施函数中,降低维护成本。对于 CLI 参数类型推断的设计有参考价值。
回归测试改用 ModelScope 国际站
该 PR 是简单的 CI 基础设施调整,无需深入精读,但可供关注 CI 稳定性的团队参考。
原始 PR · 作者 wangxingran222 · 合并时间 2026-05-10 10:44
修复多模态模型 SP 和 PP+SP residual 处理 bug
值得精读的设计:residual 切片使用 `tp_rank` 感知的索引,以及 `sync_and_gather_intermediate_tensors` 中通过 all-gather 保证 SP + PP 兼容性。此外,团队对三种方案的权衡分析展现了良好的设计思维。建议关注后续 #36823 和 MoE SP 相关 PR。
修复 NemotronV3 解析器 whitespace-only 内容
该 PR 变更简单,可直接合并。建议后续添加对应 edge case 的单元测试,防止回归。
参与讨论