#35571 [sampling] Fix int32 offset overflow in top-k renorm Triton kernels
原始 PR · 作者 merrymercy · 合并时间 2026-08-20 08:48
修复 top-k renorm Triton 内核 int32 偏移溢出。
该 PR 为小而关键的 bugfix,值得精读以了解 Triton 偏移计算的陷阱。建议关注是否存在其他类似溢出点,并考虑补充回归测试。
标签列表
聚合结果
原始 PR · 作者 merrymercy · 合并时间 2026-08-20 08:48
修复 top-k renorm Triton 内核 int32 偏移溢出。
该 PR 为小而关键的 bugfix,值得精读以了解 Triton 偏移计算的陷阱。建议关注是否存在其他类似溢出点,并考虑补充回归测试。
原始 PR · 作者 JINO-ROHIT · 合并时间 2026-07-21 14:58
修复 SM120 设备上 MoE tile scatter 回退
该 PR 解决了一个明确的兼容性问题,但模块级别的 CUDA 上下文初始化存在潜在风险。建议后续提交一个惰性初始化的优化 PR 来解决该问题。整体上值得合入。
原始 PR · 作者 merrymercy · 合并时间 2026-07-20 06:02
修复 ROCm 融合 KV 和 KDA 路径的同步与池类型问题
值得精读的部分在于处理统一池与混合池差异的设计决策,以及 Triton 内核中同步屏障的添加方式。对于维护 ROCm 后端的工程师有直接参考价值。
避免FLA L2-norm按token数重编译
该 PR 值得精读,展示了 Triton 内核性能优化中避免过度特化的经典技巧(`do_not_specialize`)。对于维护 Triton 内核的团队,应评估是否有其他编译时常量(如序列长度、批次大小)可转为动态参数以降低编译开销。
原始 PR · 作者 weireweire · 合并时间 2026-07-08 11:35
消除 DSV4 预填充 Triton 重编译停顿
值得精读。展示了如何通过将 `tl.constexpr` 转换为运行时标量并使用 `do_not_specialize` 来消除不必要的 Triton 内核特化,对使用 Triton 的高性能推理项目有重要参考价值。同时防御性断言增强也值得学习。
支持 Triton MLA FP8 KV 缓存,长序列性能提升 91%
值得所有关注 MLA 和 Triton 内核优化的工程师精读。特别是 `v = tl.trans(k)` 技巧、KV Splits 的动态计算、以及 PDL 的使用都是可以直接复用到其他模型的优化模式。建议在后续 PR 中补充单元测试和 `k_scale==v_scale` 的检查。