Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

triton 相关 PR

2026-08-20
2026-07-21

#31669 Sm120 scatter fallback

原始 PR · 作者 JINO-ROHIT · 合并时间 2026-07-21 14:58

缺陷修复 重要性 5.38 洞察度 4.00

修复 SM120 设备上 MoE tile scatter 回退

该 PR 解决了一个明确的兼容性问题,但模块级别的 CUDA 上下文初始化存在潜在风险。建议后续提交一个惰性初始化的优化 PR 来解决该问题。整体上值得合入。

2026-07-20

#31688 Fix ROCm fused KV and KDA paths

原始 PR · 作者 merrymercy · 合并时间 2026-07-20 06:02

缺陷修复 重要性 5.59 洞察度 4.00

修复 ROCm 融合 KV 和 KDA 路径的同步与池类型问题

值得精读的部分在于处理统一池与混合池差异的设计决策,以及 Triton 内核中同步屏障的添加方式。对于维护 ROCm 后端的工程师有直接参考价值。

2026-07-18
性能优化 重要性 4.12 洞察度 5.00

避免FLA L2-norm按token数重编译

该 PR 值得精读,展示了 Triton 内核性能优化中避免过度特化的经典技巧(`do_not_specialize`)。对于维护 Triton 内核的团队,应评估是否有其他编译时常量(如序列长度、批次大小)可转为动态参数以降低编译开销。

2026-07-08
性能优化 重要性 6.52 洞察度 7.00

消除 DSV4 预填充 Triton 重编译停顿

值得精读。展示了如何通过将 `tl.constexpr` 转换为运行时标量并使用 `do_not_specialize` 来消除不必要的 Triton 内核特化,对使用 Triton 的高性能推理项目有重要参考价值。同时防御性断言增强也值得学习。

2026-05-07

#20479 Support Triton MLA FP8 KV cache

原始 PR · 作者 b8zhong · 合并时间 2026-05-07 09:32

性能优化 重要性 6.54 洞察度 6.00

支持 Triton MLA FP8 KV 缓存,长序列性能提升 91%

值得所有关注 MLA 和 Triton 内核优化的工程师精读。特别是 `v = tl.trans(k)` 技巧、KV Splits 的动态计算、以及 PDL 的使用都是可以直接复用到其他模型的优化模式。建议在后续 PR 中补充单元测试和 `k_scale==v_scale` 的检查。