执行摘要
临时禁用不可用的 GB300 CI 运行器
4-gpu-gb300 运行器当前不可用,需防止 CI 和 release 工作流等待或分配该失效运行器,直至其恢复。
值得精读,作为临时禁用 CI 运行器的标准做法,特别是保留注册以便回滚的设计。
无 review 评论或讨论。
4-gpu-gb300 运行器当前不可用,需防止 CI 和 release 工作流等待或分配该失效运行器,直至其恢复。
值得精读,作为临时禁用 CI 运行器的标准做法,特别是保留注册以便回滚的设计。
无 review 评论或讨论。
.github/workflows/_pr-test-stage.yml 的共享 CUDA 阶段,在运行器分配前增加守卫,跳过 inputs.runner_config == '4-gpu-gb300',覆盖 PR 与 nightly 套件。.github/workflows/rerun-test.yml 中,为 CUDA 和 multimodal 的 rerun 增加守卫,拒绝针对 4-gpu-gb300 的重跑请求。.github/workflows/release-whl-deepgemm.yml 中,临时注释掉 GB300 aarch64 的矩阵条目,避免 release 构建尝试使用该运行器。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
.github/workflows/_pr-test-stage.yml |
CI 工作流 | modified | 3.18 |
.github/workflows/rerun-test.yml |
CI 工作流 | modified | 3.41 |
.github/workflows/release-whl-deepgemm.yml |
CI 工作流 | modified | 3.29 |
.github/workflows/_pr-test-stage.yml
infrastructure
共享 CUDA 阶段增加运行器守卫,覆盖 PR 和 nightly 套件,是核心变更。
# .github/workflows/_pr-test-stage.yml
# 临时跳过失效的 GB300 运行器,避免 CI 等待或分配。
if: |
always() &&
inputs.runner_config != '4-gpu-gb300' &&
((github.event_name == 'schedule' || fromJson(inputs.caller_inputs).test_parallel_dispatch == true) ||
(!failure() && !cancelled())) &&
(fromJson(inputs.check_changes).main_package == 'true' || fromJson(inputs.check_changes).sgl_kernel == 'true')
# runs-on 从 runs_on_map 解析;check-changes 已替换。
.github/workflows/rerun-test.yml
infrastructure
拒绝针对 GB300 的 CUDA 和 multimodal rerun,避免手动重跑等待失效运行器。
# .github/workflows/rerun-test.yml
# 临时拒绝针对失效 GB300 运行器的 rerun 请求。
rerun-test-cuda:
if: inputs.mode == 'cuda' && inputs.runs_on != '4-gpu-gb300'
runs-on: ${{ inputs.runs_on }}
# ...
rerun-test-multimodal-gen:
if: inputs.mode == 'multimodal_gen' && inputs.runs_on != '4-gpu-gb300'
runs-on: ${{ inputs.runs_on }}
# ...
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险较低,仅涉及工作流调度,不影响模型输出。但若 GB300 运行器恢复后未及时回滚,可能导致相关测试和构建被永久跳过,需要持续跟踪运行器状态。
影响 CI 与 release 工作流,GB300 相关的测试和构建暂时不执行,可能延迟相关硬件的回归测试。对用户无直接功能影响。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论