#25455 [NPU] MiMo-V2-Flash Adaptation
原始 PR · 作者 iridiumine · 合并时间 2026-06-10 09:13
在 Ascend NPU 上实现 MiMo-V2-Flash 多 Token 预测推理支持
该 PR 展示了 NPU 后端适配推测解码的完整流程,包括图运行器继承模式、注意力内核迁移、数据结构调整等,设计决策清晰。推荐相关开发者精读新增的 `multi_layer_eagle_draft_extend_npu_graph_runner.py` 以及 `ascend_backend.py` 中的 `forward_mtp` 变化,以了解 NPU 图捕获与 CUDA 图的差异以及 NPU 融合注意力内核的约束。同时 `memory_pool_npu.py` 的缓冲区分离模式也是对 MHA/MLA 混合场景的有益实践。
参与讨论