Prhub

#27621 ci: partition the H200 nightly 'Run test' step across the matrix

原始 PR 作者 alisonshao 合并时间 2026-06-09 11:49 文件变更 1 提交数 1 评论 2 代码增减 +1 / -1

执行摘要

修复 H200 夜间测试步骤未分区导致重复执行

在 nightly-test-general-8-gpu-h200 工作流中,'Run test' 步骤未传递自动分区标志,导致所有分区都运行了相同的单个测试(test_unified_radix_cache_kl_nightly.py),造成 4 倍 GPU 小时浪费和重复失败报告。PR body 明确描述了这在 run 27110545438 中被观察到。

该 PR 是基础设施修复,值得快速合入。对于类似的矩阵分区,建议在其他工作流中检查是否也存在缺失分区参数的情况。

讨论亮点

该 PR 没有 review 评论,只有作者自己的一条空链接注释。但 PR body 提供了清晰的背景和验证。

实现拆解

  1. .github/workflows/nightly-test-nvidia.yml 文件的第 231 行,为 'Run test' 步骤的 python3 run_suite.py 命令添加 --auto-partition-id=${{ matrix.partition }} --auto-partition-size=4 参数。
  2. 这些参数与同工作流中 'Run common 8-GPU model tests' 步骤已使用的参数一致,确保测试在 4 个分区间正确分区。
  3. 验证:使用 size=4 对该套件进行分区预演,单个测试仅分配给一个分区,其余三个分区跳过(显示 "No tests found...Skipping")。
文件 模块 状态 重要度
.github/workflows/nightly-test-nvidia.yml 部署脚本 modified 2.78

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

风险极低。变更仅添加两个已存在的 CLI 参数,并且这些参数在兄弟步骤中已验证。可能的风险是分区后测试数量不均匀,但当前只有一个测试,且后续扩展时 partitioner 会自然处理。

直接影响:H200 夜间测试工作流的 'nightly-test-general-8-gpu-h200' 作业现在将正确分区,每个测试仅运行一次,而不是四次,节省约 75% 的 GPU 预算(当前套件一个测试约 900s,4× 变成 1×)。间接影响:减少 CI 队列积压和失败通知噪音。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论