#49453 [CPU] Add MLA backend so DeepSeek-V2/V3 can run on CPU
原始 PR · 作者 maobaolong · 合并时间 2026-08-06 16:51
CPU 新增 MLA 后端,DeepSeek-V2/V3 可在 CPU 运行
值得精读。重点关注三处设计决策:① 如何通过继承 `MLACommonBackend/Impl` 复用共享 MLA 脚手架,同时用 "跳过父类 `__init__` + 手动复制属性" 规避 GPU kernel 依赖;② 将 CPU 专属的 KV cache 写入逻辑内联进 `do_kv_cache_update` 而非污染公共算子;③ ARM 与 x86 在 `Vectorized<float>` 默认构造语义上的差异如何导致隐性 bug。该 PR 也是后续 CPU MLA 性能优化的起点。
参与讨论