#50133 [CPU] Migrate unquantized MoE to the modular-kernel experts structure
原始 PR · 作者 bigPYJ1151 · 合并时间 2026-08-03 14:55
CPU 未量化 MoE 迁移到模块化内核专家结构
值得精读。这是 vLLM 将 CPU MoE 完全纳入 modular-kernel/oracle 体系的关键一步,其中三个设计决策尤其值得借鉴:一是路由参数在 `process_weights_after_loading` 中从 layer 捕获以弥补 monolithic `apply()` 签名限制;二是不支持的形状“报错并提示调参”而非静默回退;三是评审过程中通过补齐向量原语将 grouped gemm 扩展到所有 ISA、直接删除 torch 回退的取舍过程。建议同时关注其与并行 PR 的合并顺序。
参与讨论