#39458 [MLA] Optimize mla indexer prepare uniform decode for MTP > 1
原始 PR · 作者 TheEpicDolphin · 合并时间 2026-04-17 07:27
优化MLA注意力索引器uniform decode路径,通过Triton kernel减少推测解码开销。
建议精读此PR,特别关注Triton kernel的设计和`_prepare_decode_tensors`中的条件分支,这是性能优化的核心。对于从事注意力后端、推测解码或kernel优化的工程师,可学习如何针对uniform场景进行针对性优化。
参与讨论