Prhub

#29409 [AMD] Split qwen3.5 triton DCP test into its own nightly job

原始 PR 作者 yctseng0211 合并时间 2026-07-01 15:39 文件变更 3 提交数 2 评论 2 代码增减 +75 / -1

执行摘要

拆分 AMD 夜测任务避免超时

AMD 夜测 job nightly-8-gpu-mi35x-qwen35 持续超时,因为该 job 的 step 中顺序执行两个测试文件:test_qwen35_eval_mi35x.py(预估 3600 秒)和 test_qwen3p5_triton_dcp.py(预估 4800 秒),合计约 8400 秒,超过该 step 的 timeout-minutes: 120(7200 秒)。

值得合并,解决了夜测稳定性痛点,不影响任何生产代码,且已在两个 ROCm 版本上验证通过。对于 CI 维护者,可参考此模式拆分其他超时 job。

讨论亮点

无实质 review 讨论。只有 gemini-code-assist[bot] 的自动评论确认变更内容,以及 HaiShaw 的批准。

实现拆解

  1. 修改测试注册套件名:在 test/registered/amd/test_qwen3p5_triton_dcp.py 中将 register_amd_cisuite 参数从 nightly-amd-accuracy-8-gpu-mi35x-qwen35 改为新的独立套件名 nightly-amd-accuracy-8-gpu-mi35x-qwen35-triton-dcp,使该测试从原 job 中脱离。
  2. 新增独立 job 定义(ROCm 默认版):在 .github/workflows/nightly-test-amd.yml 中添加新 job nightly-8-gpu-mi35x-qwen35-triton-dcp,包含完整的 CI 步骤(checkout、清理 VRAM、启动容器、安装依赖、运行测试),并设置 timeout-minutes: 120,专门运行新套件的测试。
  3. 新增独立 job 定义(ROCm 7.2 版):在 .github/workflows/nightly-test-amd-rocm720.yml 中添加对应 job nightly-8-gpu-mi35x-qwen35-triton-dcp-rocm720,与默认版结构一致,仅使用 ROCm 7.2 容器。
  4. 注册新 job 到调度入口和依赖列表:在两个 workflow 文件的 on 触发列表和 check-all-jobs(或类似汇总 job)的 needs 列表中添加新 job 名称,确保它们能被手动选择并参与全量检查。
  5. 完成上述变更后,原 job nightly-8-gpu-mi35x-qwen35 仅运行 test_qwen35_eval_mi35x.py(约 3600 秒),新 job 运行 test_qwen3p5_triton_dcp.py(约 4800 秒),各在 120 分钟内稳定完成。
文件 模块 状态 重要度
.github/workflows/nightly-test-amd.yml CI 配置 modified 4.65
.github/workflows/nightly-test-amd-rocm720.yml CI 配置 modified 4.65
test/registered/amd/test_qwen3p5_triton_dcp.py AMD 测试 modified 3.99

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低。变更仅涉及 CI 配置文件(.github/workflows/*.yml)和测试注册套件名的字符串修改,不涉及任何生产代码逻辑。唯一风险是新 job 的配置可能有遗漏(如 runner 标签、环境变量),但 PR 作者已在两个 ROCm 版本上运行验证并通过。

对用户无影响。对系统:AMD 夜测流水线将更稳定,不再因超时导致整组测试失败,Qwen3.5 Triton DCP 测试获得独立的执行时间和失败报告。对团队:CI 维护者需关注新 job 的长期运行状态和资源占用(额外占用 8-GPU MI35x 机器约 80 分钟)。

CI 配置变更 无生产代码影响

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论