#27352 [AMD] fix(ci): run partition 3 of stage-c-test-large-8-gpu-amd
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-05 15:06
修复 AMD CI 分区 3 被跳过的问题
该 PR 值得合入,它修复了一个静默跳过测试的配置 bug,且修改量极小(一行)。无需深入代码审查,但应确保新增分区 3 的测试在后续 CI 运行中稳定通过。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 yctseng0211 · 合并时间 2026-06-05 15:06
修复 AMD CI 分区 3 被跳过的问题
该 PR 值得合入,它修复了一个静默跳过测试的配置 bug,且修改量极小(一行)。无需深入代码审查,但应确保新增分区 3 的测试在后续 CI 运行中稳定通过。
原始 PR · 作者 Hide-on-bushsh · 合并时间 2026-06-05 14:27
新增 GLM 模型 NPU 最佳实践文档,修复链接和路径
对于在 Ascend NPU 上部署 GLM 模型的用户,本 PR 提供的文档具有直接参考价值。对于文档维护者,可以关注 review 中对锚点 slug 化处理和硬编码路径替换的讨论,作为文档编写最佳实践。建议合并后对锚点链接进行自动化校验,防止未来因渲染规则变化导致失效。
修复 CP 模式下 all_reduce/barrier 的通信组
此 PR 是必要的修复,设计清晰,推荐合入。可作为统一通信组调用的好例子。
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-05 13:11
将 FlashMLA KV 索引构建并行化,长上下文延迟从 15us 降至 1-2us
值得精读 kernel 层面的并行化模式。此 PR 展示了如何通过简单的 grid 维度扩展将显式循环转换为 GPU 块级并行,是注意力后端性能优化的典型技巧。
修复Frozen-KV MTP验证批量全部完成时缺少merge_batch的崩溃
建议精读此PR,了解Frozen-KV MTP中verify和draft输入的生命周期管理。其中的空闲输入处理模式(`create_idle_input`)在其他推测解码实现中也有类似应用,值得参考。对于使用Frozen-KV MTP的团队,建议尽快合并。
原始 PR · 作者 liuxianglong17 · 合并时间 2026-06-05 11:39
修复 Ascend NPU 夜间测试超时和 warning 问题
该 PR 为常规维护性修复,无深度技术洞察,可快速合并。
同步遗留文档至 Mintlify 站点
本 PR 为纯文档同步操作,技术复杂度低,但具有重要的维护意义。建议所有文档贡献者阅读此 PR 的 commits 列表以了解如何确保文档一致性。值得关注的决策:被跳过的 PR 清单和原因(避免回退更新的内容)。
修复 MMMU VLM 评估 max_tokens 过短导致全部失败
建议合入。这是一个有明确回归根因的测试修复,变更量极小,且已在 H200 上验证所有模型通过阈值。合并后应观察夜间测试是否稳定通过。
参与讨论