新增 H20 Qwen3.8 MoE 调优配置与工具修复
值得快速阅读:若团队在 H20 或同类 GPU 上做 MoE 推理调优,这份 PR 演示了 tuned config 从生成(tuning_fused_moe_triton.py)、加载匹配到验证(micro benchmark + e2e + 数值一致性)的完整闭环。重点看配置文件的 M 分桶规律及其与默认启发式的差异、common_utils.py 架构分支组织方式,以及作者对精度噪声的论证。若没有 Qwen3.8/H20 场景,可只关注调优工具的架构识别修复一处。
参与讨论