#30319 [NPU] Add mxfp4-w4a4 MOE Quantization Support for NPU
原始 PR · 作者 LinyuanLi0046 · 合并时间 2026-08-19 00:06
NPU 新增 ModelSlim W4A4 MXFP4 MoE 量化路径
值得 NPU 量化相关开发者精读。本 PR 展示了三个值得借鉴的设计决策:一是在 dispatcher 能力受限时选择 BF16 dispatch + 紧邻 GMM 前动态量化的延迟量化策略;二是通过 `use_mx_quant` 开关把 FP4 这类 torch dtype 对象无法直接识别的 MX 数据类型收敛进公共量化器;三是面对性能优化建议时以 profiling 数据为依据、明确拒绝并建议后续独立 PR,保持改动范围可控。
参与讨论