# PR #6972 完整报告

- 仓库：`verl-project/verl`
- 标题：[trainer] fix: stabilize Qwen3 Next 80B FSDP rollout on NPU
- 合并时间：2026-07-07 23:15
- 原文链接：http://prhub.com.cn/verl-project/verl/pull/6972

---

# 执行摘要

- 一句话：调整 Qwen3 Next 80B NPU GRPO 示例配置
- 推荐动作：该 PR 是配置层面的调整，变更简单且安全，建议合并。对于关注 Ascend NPU 大模型训练稳定的用户，可参考此配置调整。

# 功能与动机

PR#6346 为 NPU 添加了 expandable segment 支持，但在 Qwen3 Next 80B 示例中，`update_weights` 阶段会观察到更高的 NPU 峰值内存。为了避免 OOM，需要让 rollout 阶段占用更少的内存，因此采取更保守的配置。

# 实现拆解

1. **修改 `gen_tp` 参数**：在 `examples/ascend_extras/grpo_trainer/run_qwen3_next_80b_fsdp.sh` 中，将 `gen_tp=4` 改为 `gen_tp=8`，将 rollout 生成阶段分布到更多 tensor parallel rank 上，降低每个 rank 的显存压力。
2. **修改 `gpu_memory_utilization` 参数**：将 `actor_rollout_ref.rollout.gpu_memory_utilization` 从 0.8 调整为 0.6，减少 rollout 阶段对 NPU 内存的占用，为 `update_weights` 阶段预留更多内存空间。
3. **无其他变更**：该 PR 仅包含上述两个参数调整，无代码逻辑、API 或测试变更。

关键文件：
- `examples/ascend_extras/grpo_trainer/run_qwen3_next_80b_fsdp.sh`（模块 示例脚本；类别 other；类型 core-logic）: 该文件是唯一的变更文件，通过调整 `gen_tp` 和 `gpu_memory_utilization` 两个参数来缓解 rollout 阶段 NPU 内存压力，影响 Qwen3 Next 80B FSDP GRPO 训练示例的配置。

关键符号：未识别

## 关键源码片段

### `examples/ascend_extras/grpo_trainer/run_qwen3_next_80b_fsdp.sh`

该文件是唯一的变更文件，通过调整 `gen_tp` 和 `gpu_memory_utilization` 两个参数来缓解 rollout 阶段 NPU 内存压力，影响 Qwen3 Next 80B FSDP GRPO 训练示例的配置。

```bash
# ...
sp_size=8

# 将生成时的 tensor parallel size 从 4 增加到 8，
# 以分散 rollout 阶段的显存占用。
gen_tp=8

use_dynamic_bsz=True
# ...

ROLLOUT=(
  actor_rollout_ref.rollout.name=vllm
  actor_rollout_ref.rollout.n=${rollout_n}
  actor_rollout_ref.rollout.tensor_model_parallel_size=${gen_tp}
  # 降低 GPU 内存利用率，为 update_weights 阶段释放更多内存空间
  actor_rollout_ref.rollout.gpu_memory_utilization=0.6
  actor_rollout_ref.rollout.load_format=auto
  # ...
)

```

# 评论区精华

该 PR 没有 review 讨论。审核人 `wucong25` 已批准，`gemini-code-assist[bot]` 的评论为自动生成且无实质内容。

- 暂无高价值评论线程

# 风险与影响

- 风险：风险极低。仅修改示例脚本中的配置参数，不影响其他模块或用户。若 `gen_tp=8` 导致 tensor parallel 通信开销增加，可能略微降低 rollout 吞吐量；`gpu_memory_utilization` 降低可能减少 batch size 上限。但这些调整是为稳定性做出的折中。
- 影响：
 - **用户影响**：使用该示例脚本的用户需要调整集群配置以支持 `gen_tp=8`（可能需要更多 GPU 或更小的 rank 数），但 NPU 内存占用更安全。
 - **系统影响**：仅影响 Ascend NPU 环境下的 Qwen3 Next 80B 示例。
 - **团队影响**：无需其他团队配合。
 - 风险标记：配置调整 , 无测试覆盖

# 关联脉络

- PR #6346 [trainer] feat: add set_expandable_segments support for npu: 该 PR 添加了 NPU expandable segment 支持，导致 `update_weights` 阶段峰值内存升高，是本 PR 变更的根本原因。
- PR #6971 [trainer] fix: stabilize Qwen3 Next 80B FSDP rollout on NPU: 该 PR 是本 PR 在 release 分支上的对应版本，内容相同。