Prhub

#51293 [CI] Re-enable FI autotune in GSM8K config for Qwen3.5-35B-A3B

原始 PR 作者 arpera 合并时间 2026-08-07 10:42 文件变更 1 提交数 1 评论 2 代码增减 +0 / -1

执行摘要

重新启用 Qwen3.5-35B-A3B CI 的 FlashInfer MoE autotune

根据 issue #46083,test_gsm8k_correctness[Qwen3.5-35B-A3B-DEP2] 在 B200 上因 FlashInfer trtllm_bf16_moe autotune 崩溃导致 CI 失败,PR #45002 通过添加 --no-enable-flashinfer-autotune 绕开该问题。现在 autotune bug 已修复,PR 作者在 commit 5fba75aefeedcf5b6cc27abf9bc145b6a49873a7 上验证复现测试通过,因此移除该参数以重新启用 autotune,恢复对真实推理路径的 CI 覆盖。

不值得精读,属于低风险配置回归。可留意其关联的 issue #46083 是否被正式关闭,以及后续 CI 是否稳定;若想了解 FlashInfer MoE autotune 的机制,可结合 #46083 和 #45002 一起阅读。

讨论亮点

本 PR 的 review 讨论较少:claude[bot] 自动评论指出该 PR 来自 fork,自动 review 被禁用,需维护者手动触发;维护者 ZJY0516 直接批准并回复 'Thanks'。没有关于实现或风险的技术讨论。

实现拆解

变更入口是 tests/evals/gsm8k/configs/Qwen3.5-35B-A3B-DEP2.yaml,从 server_args 中删除一行 --no-enable-flashinfer-autotune,使 FlashInfer MoE autotune 回到默认开启状态。

实现步骤如下:

  1. 编辑配置文件,移除禁用 autotune 的参数(+0/-1 行),恢复 server 启动参数为原有的 --max-model-len 4096 --data-parallel-size 2 --enable-expert-parallel
  2. 执行复现测试:cd tests && pytest -s -v evals/gsm8k/test_gsm8k_correctness.py --config-list-file=configs/models-qwen35-blackwell.txt -k Qwen3.5-35B-A3B-DEP2,确认无失败。
  3. 无其他源码、文档或部署配套改动,属于纯测试配置调整。
文件 模块 状态 重要度
tests/evals/gsm8k/configs/Qwen3.5-35B-A3B-DEP2.yaml 评测配置 modified 3.11

关键源码片段

tests/evals/gsm8k/configs/Qwen3.5-35B-A3B-DEP2.yaml test-coverage

唯一变更文件,通过删除 `--no-enable-flashinfer-autotune` 恢复 FlashInfer MoE autotune 的 CI 覆盖,直接对应 PR 目的。

# Qwen3.5-35B-A3B-DEP2 GSM8K 评测配置
# 变更说明:删除 --no-enable-flashinfer-autotune,
# 恢复 FlashInfer MoE 内核自动调优(默认开启),
# 对应 issue #46083 的 workaround 已被 bug 修复替代。
model_name: "Qwen/Qwen3.5-35B-A3B"
accuracy_threshold: 0.84
tolerance: 0.03
num_questions: 1319
num_fewshot: 5
server_args: >-
  --max-model-len 4096
  --data-parallel-size 2
  --enable-expert-parallel

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

主要风险是 FlashInfer MoE autotune 问题复发的可能性:即使作者声称 bug 已修复并跑过复现测试,但该崩溃曾在多个 nightly CI 日期间歇性出现,若修复不彻底会导致 CI 重新变红。另外,重新启用 autotune 会增加 CI 任务中的 autotune 耗时(21 个 profile 的 tuning),但这是恢复默认行为而非新增开销。

影响范围仅限 CI 测试覆盖:恢复 LM Eval Qwen3.5 Models (B200) 作业中 Qwen3.5-35B-A3B-DEP2 配置对 FlashInfer autotune 路径的验证。对服务代码、推理行为、用户 API 均无影响;对团队而言,减少了 workaround 配置的遗留债务。

CI 稳定性依赖外部 bug 修复 测试配置回归

关联 Issue

#45002 [Bugfix] fix qwen3.5 ep weight loading
#46083 [Bug]: GPU coredump during FlashInfer `trtllm_bf16_moe` autotune with Qwen3.5-35B-A3B on B200 (DP=2 + EP)

完整报告

参与讨论