执行摘要
将 Ascend CI 脚本默认 GPU 数从 16 改为 8
根据 PR 描述,A2 机器每节点只有 8 个 NPU,而原脚本默认 NGPUS_PER_NODE=16,与实际硬件不匹配,可能导致 CI 运行时资源申请错误。本 PR 为纯 CI 配置修正。
作为常规 CI 配置修正,值得快速整合。可借鉴其按硬件规格调整默认参数的做法,建议后续检查其他类似脚本是否存在类似硬编码。
无 review 评论,只有 wucong25 的 APPROVED 状态,审核通过。
根据 PR 描述,A2 机器每节点只有 8 个 NPU,而原脚本默认 NGPUS_PER_NODE=16,与实际硬件不匹配,可能导致 CI 运行时资源申请错误。本 PR 为纯 CI 配置修正。
作为常规 CI 配置修正,值得快速整合。可借鉴其按硬件规格调整默认参数的做法,建议后续检查其他类似脚本是否存在类似硬编码。
无 review 评论,只有 wucong25 的 APPROVED 状态,审核通过。
tests/special_npu/nightly_ci_ascend/run_gspo_qwen3_8b_fsdp2_npu.sh 中的默认 NGPUS_PER_NODE 值,从 16 改为 8,对齐 A2 硬件规格。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
tests/special_npu/nightly_ci_ascend/run_gspo_qwen3_8b_fsdp2_npu.sh |
NPU CI | modified | 3.59 |
tests/special_npu/nightly_ci_ascend/run_gspo_qwen3_8b_fsdp2_npu.sh
test-coverage
唯一变更文件,调整默认 NGPUS_PER_NODE 从 16 到 8,并补充末尾换行。
# 关键参数:调整默认 NGPUS_PER_NODE 以匹配 A2 硬件规格
NGPUS_PER_NODE=${NGPUS_PER_NODE:-8} # 从 16 改为 8(A2 每节点 8 个 NPU)
# 其余脚本内容保持不变
# 后续 launch 部分:
PYTHONUNBUFFERED=1 python3 -m verl.trainer.main_ppo \
"${DATA[@]}" \
"${MODEL[@]}" \
"${ACTOR[@]}" \
"${REF[@]}" \
"${ROLLOUT[@]}" \
"${TRAINER[@]}" \
"$@" 2>&1 | tee "$LOG_DIR/$SCRIPT_NAME.log"
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
风险极低。改动仅涉及 CI 脚本默认参数,不影响训练代码。唯一潜在风险是若其他硬件(如非 A2 机器)仍使用 16 NPU,则默认值被改变可能影响其 CI 运行,但该脚本专为 A2 设备准备,且可通过环境变量覆盖。
影响范围限于 Ascend NPU 夜间 CI 的运行,使其默认参数与实际硬件匹配,避免资源申请错误。对用户无直接影响,对团队降低了 CI 配置维护成本。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论