执行摘要
- 一句话:修复 H200 夜间测试步骤未分区导致重复执行
- 推荐动作:该 PR 是基础设施修复,值得快速合入。对于类似的矩阵分区,建议在其他工作流中检查是否也存在缺失分区参数的情况。
功能与动机
在 nightly-test-general-8-gpu-h200 工作流中,'Run test' 步骤未传递自动分区标志,导致所有分区都运行了相同的单个测试(test_unified_radix_cache_kl_nightly.py),造成 4 倍 GPU 小时浪费和重复失败报告。PR body 明确描述了这在 run 27110545438 中被观察到。
实现拆解
- 在
.github/workflows/nightly-test-nvidia.yml 文件的第 231 行,为 'Run test' 步骤的 python3 run_suite.py 命令添加 --auto-partition-id=${{ matrix.partition }} --auto-partition-size=4 参数。
- 这些参数与同工作流中 'Run common 8-GPU model tests' 步骤已使用的参数一致,确保测试在 4 个分区间正确分区。
- 验证:使用 size=4 对该套件进行分区预演,单个测试仅分配给一个分区,其余三个分区跳过(显示 "No tests found...Skipping")。
关键文件:
.github/workflows/nightly-test-nvidia.yml(模块 部署脚本;类别 infra;类型 infrastructure): 唯一修改的文件,添加了分区参数,修复了重复执行问题。
关键符号:未识别
评论区精华
该 PR 没有 review 评论,只有作者自己的一条空链接注释。但 PR body 提供了清晰的背景和验证。
风险与影响
- 风险:风险极低。变更仅添加两个已存在的 CLI 参数,并且这些参数在兄弟步骤中已验证。可能的风险是分区后测试数量不均匀,但当前只有一个测试,且后续扩展时 partitioner 会自然处理。
- 影响:直接影响:H200 夜间测试工作流的 'nightly-test-general-8-gpu-h200' 作业现在将正确分区,每个测试仅运行一次,而不是四次,节省约 75% 的 GPU 预算(当前套件一个测试约 900s,4× 变成 1×)。间接影响:减少 CI 队列积压和失败通知噪音。
- 风险标记:暂无
关联脉络
- PR #27627 ci: run pr-test-extra on release branch cuts (not just base suites): 同样是对 CI 工作流的分区/条件逻辑的改进,属于同一维护方向。
参与讨论