#38815 [Quant] add CompressedTensorsW8A8Mxfp8 for linear and MoE layers
原始 PR · 作者 EdalatiAli · 合并时间 2026-04-12 07:21
新增压缩张量后端 MXFP8 量化方案,支持线性层和 MoE 层。
该 PR 值得精读,特别是量化方案检测和 MoE 方法实现,展示了如何扩展压缩张量后端以支持新格式。关注点包括:设计上如何集成 MXFP8 到现有量化框架,review 中讨论的模块性权衡,以及内核选择逻辑的演变。对于涉及量化或高性能推理的开发者,这是学习 vLLM 量化扩展机制的案例。
参与讨论