Prhub

#49881 [CI] Increase Qwen3.5 MTP GSM8K generation length

原始 PR 作者 ZJY0516 合并时间 2026-07-28 18:04 文件变更 1 提交数 2 评论 2 代码增减 +2 / -1

执行摘要

增大 Qwen3.5 MTP GSM8K 评估生成长度

GSM8K评估的默认max_tokens=256过短,导致Qwen3.5 MTP3的思维链被截断,提取的最后一个整数可能不正确,准确率(0.8469)低于阈值(0.8500)。PR body明确说明了失败构建链接和数值依据。

可直接合入。变更简单明确,已获得批准,且不影响其他功能。

讨论亮点

review中AndreasKaratzas批准,但建议若非紧急则让khluu审阅。机器人chatgpt-codex-connector[bot]要求补充测试证据和结果。

实现拆解

  1. tests/evals/gsm8k/configs/Qwen3.5-397B-A17B-NVFP4-DEP2-MTP.yaml中新增max_tokens: 12000字段,覆盖默认的256。
  2. server_args中的--max-model-len从4096改为16384,为推理提供足够上下文。
  3. 非MTP配置不变,避免影响其他评估。
文件 模块 状态 重要度
tests/evals/gsm8k/configs/Qwen3.5-397B-A17B-NVFP4-DEP2-MTP.yaml 测试配置 modified 3.52

关键源码片段

tests/evals/gsm8k/configs/Qwen3.5-397B-A17B-NVFP4-DEP2-MTP.yaml test-coverage

唯一变更文件,调整 GSM8K 评估的生成长度和模型长度。

# tests/evals/gsm8k/configs/Qwen3.5-397B-A17B-NVFP4-DEP2-MTP.yaml
model_name: "nvidia/Qwen3.5-397B-A17B-NVFP4"
accuracy_threshold: 0.88
tolerance: 0.03
num_questions: 1319
num_fewshot: 5
# 新增 : 覆盖默认 max_tokens=256,确保 MTP 推理完整
max_tokens: 12000
server_args: >-
  # 从 4096 提升至 16384,为长思维链提供足够上下文
  --max-model-len 16384
  --data-parallel-size 2
  --enable-expert-parallel
  --max-num-seqs 384
  --spec-method mtp
  --spec-tokens 3

评论区精华

补充评估证据 question

机器人要求提供测试命令和结果,证明 12,000 tokens 能恢复准确率且不超 CI 超时。

结论:未明确回复,但 AndreasKaratzas 已批准,认为只要不超时即可。 · 已解决

风险与影响

风险低。仅修改单一测试配置文件,增大生成长度和模型长度可能增加CI运行时间,但仍在45分钟超时内(AndreasKaratzas确认)。

仅影响Qwen3.5-397B MTP3的GSM8K评估配置,其他配置不变。修复后MTP评估准确率应恢复至阈值以上。

测试配置变更

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论