#45744 [M3] Enable FP8 sparse GQA
原始 PR · 作者 gau-nernst · 合并时间 2026-06-17 12:38
MiniMax-M3 支持 FP8 稀疏 GQA
建议精读此 PR,以了解如何在稀疏注意力模型中集成 FP8 KV cache 支持,以及如何将手动 fallback 路径融合到统一 kernel 中。`select_main_impl_cls` 的选择逻辑调整(从 `is_quantized_kv_cache` 到 dtype 精确判断)是一个值得关注的设计决策。
参与讨论