# PR #27621 完整报告

- 仓库：`sgl-project/sglang`
- 标题：ci: partition the H200 nightly 'Run test' step across the matrix
- 合并时间：2026-06-09 11:49
- 原文链接：http://prhub.com.cn/sgl-project/sglang/pull/27621

---

# 执行摘要

- 一句话：修复 H200 夜间测试步骤未分区导致重复执行
- 推荐动作：该 PR 是基础设施修复，值得快速合入。对于类似的矩阵分区，建议在其他工作流中检查是否也存在缺失分区参数的情况。

# 功能与动机

在 nightly-test-general-8-gpu-h200 工作流中，'Run test' 步骤未传递自动分区标志，导致所有分区都运行了相同的单个测试（test_unified_radix_cache_kl_nightly.py），造成 4 倍 GPU 小时浪费和重复失败报告。PR body 明确描述了这在 run 27110545438 中被观察到。

# 实现拆解

1. 在 `.github/workflows/nightly-test-nvidia.yml` 文件的第 231 行，为 'Run test' 步骤的 `python3 run_suite.py` 命令添加 `--auto-partition-id=${{ matrix.partition }} --auto-partition-size=4` 参数。
2. 这些参数与同工作流中 'Run common 8-GPU model tests' 步骤已使用的参数一致，确保测试在 4 个分区间正确分区。
3. 验证：使用 size=4 对该套件进行分区预演，单个测试仅分配给一个分区，其余三个分区跳过（显示 "No tests found...Skipping"）。

关键文件：
- `.github/workflows/nightly-test-nvidia.yml`（模块 部署脚本；类别 infra；类型 infrastructure）: 唯一修改的文件，添加了分区参数，修复了重复执行问题。

关键符号：未识别


# 评论区精华

该 PR 没有 review 评论，只有作者自己的一条空链接注释。但 PR body 提供了清晰的背景和验证。

- 暂无高价值评论线程

# 风险与影响

- 风险：风险极低。变更仅添加两个已存在的 CLI 参数，并且这些参数在兄弟步骤中已验证。可能的风险是分区后测试数量不均匀，但当前只有一个测试，且后续扩展时 partitioner 会自然处理。
- 影响：直接影响：H200 夜间测试工作流的 'nightly-test-general-8-gpu-h200' 作业现在将正确分区，每个测试仅运行一次，而不是四次，节省约 75% 的 GPU 预算（当前套件一个测试约 900s，4× 变成 1×）。间接影响：减少 CI 队列积压和失败通知噪音。
- 风险标记：暂无

# 关联脉络

- PR #27627 ci: run pr-test-extra on release branch cuts (not just base suites): 同样是对 CI 工作流的分区 / 条件逻辑的改进，属于同一维护方向。