#2700 feat(ci): add stage-c-8-gpu-b200 for the Blackwell runner
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-30 14:37
新增 stage-c-8-gpu-b200,接入 8×B200 CI runner
值得快速精读。虽然单看只是注册表加一行 + 一个 workflow job,但其中蕴含两个可复用的 CI 设计原则:一是「测试自声明 GPU 预算(ray start --num-gpus / torchrun --nproc-per-node)而不是读取可见设备」,这让不分区主机的资源分配语义清晰;二是「合入时零测试注册是安全的,因为空 stage 收集零测试并退出 0」,支撑了增量迁移的分步落地。对参与 CI 基础设施维护的工程师,建议重点关注 pr-test.yml 中 job 注释与 tests/ci/run_suite.py 的 suite 注释,这两处把「为什么这么设计」讲得最清楚。