移除MoE FP8量化中的冗余类型转换和拷贝
建议合并。这是一个小而明确的性能优化,经过精度验证(GSM8K)和 CI 测试,无风险。两个优化点(移除降级拷贝和 .contiguous())在 FP8/FP4 MoE 前向路径上直接减少了开销。对于理解 `per_token_group_quant_fp8` 接口和 MoE 推理优化有参考价值。
标签列表
聚合结果
移除MoE FP8量化中的冗余类型转换和拷贝
建议合并。这是一个小而明确的性能优化,经过精度验证(GSM8K)和 CI 测试,无风险。两个优化点(移除降级拷贝和 .contiguous())在 FP8/FP4 MoE 前向路径上直接减少了开销。对于理解 `per_token_group_quant_fp8` 接口和 MoE 推理优化有参考价值。
原始 PR · 作者 yueming-yuan · 合并时间 2026-06-10 07:13
修复 GLM NextN draft 的 v_head_dim 推导
值得精读。虽然改动了 11 行,但其背后的 root cause 揭示了 MHA/MLA 混合架构下的 `v_head_dim` 继承陷阱。核心设计要点是:当模型配置源自 MLA 架构时,`v_head_dim` 可能远大于 MHA draft 的真实 `head_dim`,必须在架构重写时显式修正。此模式可作为未来类似 MHA-over-MLA draft adapter 的参考。
原始 PR · 作者 zRzRzRzRzRzRzR · 合并时间 2026-05-26 13:17
GLM-4.7-Flash 独立 MLA 实现及 NextN 推测解码
建议仔细审查 `glm4_moe_lite_nextn.py` 的 `__init__` 是否按 review 建议修复;若未修复,应及时补充。此 PR 的独立模型设计思路值得参考,尤其 MLA NextN 的 zero_allocator 传递模式。建议合并后补充针对模型加载和 pipeline 的测试。