Prhub

#33605 [CI] Make B200 base-b suites single-GPU as prep for 1-gpu B200 runners

原始 PR 作者 hnyls2002 合并时间 2026-08-05 06:53 文件变更 2 提交数 1 评论 0 代码增减 +2 / -2

执行摘要

B200 两个 4-GPU 测试移入 base-c 套件

PR 描述指出需要把仅有的两个 4-GPU 文件移出 B200 base-b 套件,使其只包含单 GPU 测试,从而可以在 1-GPU B200 runner 上运行或利用 in-node per-GPU 并行度,提升 B200 测试资源利用率。

值得快速浏览,不必精读。核心价值在于它释放了 base-b 4-GPU 测试压力,是 B200 单 GPU runner 迁移的第一步。关注 CI 基础设施演进的工程师可以留意后续 1-GPU runner 落地 PR;本 PR 本身只是注册参数调整,设计上没有额外值得深挖的点。

讨论亮点

该 PR 没有收到任何 review 评论,作者直接合并;变更点极小且语义清晰,未见设计分歧。

实现拆解

  1. 修改 test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py:将 register_cuda_ci 的 stage 参数从 base-b 改为 base-c,runner_config 保持 4-gpu-b200,est_time 保持 340 秒,使该 DeepSeek 测试进入 base-c 的 4-GPU 队列。
  2. 修改 test/registered/kernels/ops/kimi_k3/test_collectives.py:将 register_cuda_ci 的 stage 参数从 base-b-kernel-unit 改为 base-c,runner_config 保持 4-gpu-b200,est_time 保持 240 秒;同文件中的 nightly-8-gpu-b200 注册保持不变,继续覆盖大规模通信场景。
  3. 迁移完成后,base-b-test-4-gpu-b200 与 base-b-kernel-unit-test-4-gpu-b200 不再包含任何多卡用例,全部由单 GPU 测试构成,为后续迁移到 1-GPU B200 runner 或按节点内单 GPU 并行调度扫清障碍。
  4. 本次纯属 CI 测试注册阶段调整,不涉及测试逻辑、源码、配置或部署配套改动。
文件 模块 状态 重要度
test/registered/kernels/ops/kimi_k3/test_collectives.py 集合通信 modified 3.25
test/registered/spec/eagle/test_deepseek_v3_fp4_mtp_small.py 模型测试 modified 3.25

关键符号

register_cuda_ci

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

变更仅涉及 CI 测试注册阶段,无源码或测试逻辑改动,回归风险极低。主要风险集中在 CI 资源调度侧:base-c 4-GPU 队列将新增两个任务(预估 240 秒和 340 秒),若该队列并发配额有限,可能增加排队时间;此外测试失败告警或监控若按原 stage 名称归类,base-b 到 base-c 的迁移需要同步更新视图。两个测试本身的 runner_config 仍为 4-gpu-b200,运行环境一致,不存在环境适配风险。

对最终用户无感知,属于纯 CI 基础设施调整。对 B200 测试流程的影响是:base-b 套件从多卡混跑变成单卡专用,base-c 的 4-GPU 队列统一承载 DeepSeek 与 Kimi-K3 的多卡用例。对维护 CI 的团队而言,这条 PR 是 1-GPU B200 runner 计划的前置步骤,让 base-b 系列套件具备在单卡机器上运行的能力,后续可按每 GPU 平行执行测试,提高 B200 硬件利用率。

CI 测试调度变更 base-c 队列负载上升 依赖后续单 GPU runner 落地

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论