#40172 [Perf] [Hybrid] Fused Triton kernel for GPU-side Mamba state postprocessing
原始 PR · 作者 fuscof-ibm · 合并时间 2026-05-21 19:50
融合 Triton 内核消除 Mamba 后处理 GPU 气泡,延迟降低 17%
强烈建议仔细阅读此 PR,特别是对 hybrid 模型性能优化感兴趣的工程师。其设计模式——通过 fused kernel 将 CPU 循环决策和 GPU 数据移动合并为单次启动——可适用于类似通信边界场景。此外,review 中对 acceptance rate 的深入调试和与 #42574 的对比分析也值得学习。
参与讨论