#28967 [AMD] Register 7 JIT kernel unit tests for AMD nightly CI
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-25 16:51
为7个JIT内核测试增加AMD夜间CI注册
该PR是标准的测试基础设施扩展,无技术复杂性,不值得精读。但可作为参考案例:如何在保持CUDA注册的同时,为AMD平台添加并行测试覆盖,且不破坏现有CI。
SGLang is a high-performance serving framework for large language models and multimodal models.
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-25 16:51
为7个JIT内核测试增加AMD夜间CI注册
该PR是标准的测试基础设施扩展,无技术复杂性,不值得精读。但可作为参考案例:如何在保持CUDA注册的同时,为AMD平台添加并行测试覆盖,且不破坏现有CI。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-06-25 16:50
为 AMD CI 注册 scripted-core 测试
该 PR 简单明确,变更安全,可快速合并。值得关注的是 CI 注册模式和 `est_time` 设定方法,对于后续 AMD 测试注册有参考价值。
原始 PR · 作者 rbrugaro-amd · 合并时间 2026-06-25 16:22
融合共享专家追加与 DeepEP 重映射为单个 Triton 内核
本 PR 值得相关人员精读,特别是关注 AMD MoE 推理性能优化的工程师。其设计体现了“每层一次 Triton launch”的极致融合思路,且对数值一致性有严格验证(bit-identical 断言)。代码风格和 review 中提出的修改建议(如导入简化、异常代替 assert)可作为团队代码规范参考。建议在 AMD 生产环境充分测试后,考虑将 `SGLANG_MORI_NO_PAD_MASK` 默认开启以最大化性能。
融合QK归一化、RoPE与门控的Triton内核,提升Qwen3.5吞吐量
值得关注该PR中Triton内核融合的设计模式,特别是复用RoPE cos/sin cache的方式以及PDL的使用技巧。性能优化思路可推广至其他模型。
统一异构解码结果处理与 relay payload 控制
此 PR 展示了如何在不改变行为的前提下通过抽离公共方法和统一数据结构来降低复杂度,值得阅读。特别注意 `has_sampled_token_ids` 属性和 `_relay_forward_payload` 的设计。
为 jiayisunx 添加 CI 权限
该 PR 属于常规的权限管理操作,无需深入审查。建议关注 CI 权限配置的合规性,确保只有受信任的用户被授予此类权限。
修复 eager 模式 token 缓冲不足的问题
建议精读,这是一个典型的最小化修复案例:通过取 max 替代条件分支,安全地修复潜在的 under-allocation 问题。值得关注的是 reviewer 对测试覆盖的提问,后续可考虑补充单元测试。
原始 PR · 作者 Raiden-Makoto · 合并时间 2026-06-25 14:21
跳过冗余 -inf 预填充以加速 HIP DSA 预填充
该 PR 体现了通过参数对齐消除冗余计算的典型优化手段,且提供了详尽的基准测试和单元测试验证。对于关注 AMD 平台长上下文推理性能的开发者,值得精读。设计决策值得在其他类似场景中借鉴。
参与讨论