# PR #6443 完整报告

- 仓库：`verl-project/verl`
- 标题：[megatron, cfg] feat: add Qwen3-VL-30B mbridge launch script on Ascend
- 合并时间：2026-05-22 21:10
- 原文链接：http://prhub.com.cn/verl-project/verl/pull/6443

---

# 执行摘要

- 一句话：新增 Qwen3-VL-30B Megatron 启动脚本
- 推荐动作：该 PR 值得合并，它扩展了 model 覆盖范围。建议后续补充验证结果或与现有 CI 集成。

# 功能与动机

支持 Qwen3-VL 视觉语言模型在 Megatron 后端上的强化学习训练，填补了该模型在 verl 中的启动脚本空白。

# 实现拆解

1. 在 `examples/grpo_trainer/` 目录下新建 `run_qwen3_vl_30b_a3b_megatron.sh` 文件。
2. 添加 shebang 和详细的注释 header，说明环境需求（GPU/NPU）、依赖版本（vllm, Megatron-LM, mbridge 等）以及推荐的并行配置（TP=4 PP=1 CP=1 EP=8 ETP=1 GEN_TP=4）。
3. 设置必要的环境变量如 `CUDA_DEVICE_MAX_CONNECTIONS=1`。
4. 该脚本提供了运行 Qwen3-VL-30B 的完整命令行模板。

关键文件：
- `examples/grpo_trainer/run_qwen3_vl_30b_a3b_megatron.sh`（模块 示例脚本；类别 other；类型 core-logic）: 新增的核心启动脚本，包含了完整的训练命令和依赖说明。

关键符号：未识别

## 关键源码片段

### `examples/grpo_trainer/run_qwen3_vl_30b_a3b_megatron.sh`

新增的核心启动脚本，包含了完整的训练命令和依赖说明。

```bash
#!/usr/bin/env bash
# Qwen3-VL-30B MoE GRPO RL with Megatron (single node, 8 GPUs, geo3k dataset)
#
# Requirements:
# - 8 GPUs (80GB each, e.g. 1x8 H100/H200)
# - verl==release/0.7.1
# - vllm==v0.13.0
# - Megatron-LM==0.16.0
# - mbridge==0.15.1
#
# Requirements on Ascend:
# - 8 NPUs (2*64GB each, e.g. 1x8 A3)
# - verl==release/0.7.1
# - vllm==releases/v0.13.0
# - vllm-ascend==releases/v0.13.0
# - Megatron-LM==0.16.0
# - MindSpeed==0.16.0
# - mbridge==0.15.1
#
# Tested parallelism config (8 GPUs / 1 node):
# TP=4 PP=1 CP=1 EP=8 ETP=1 GEN_TP=4
#
set -x
export CUDA_DEVICE_MAX_CONNECTIONS=1  # 启用 Megatron 的通信与计算重叠
# 后续训练命令 ...

```

# 评论区精华

无实质代码审查讨论。CLAassistant 自动评论要求签署 CLA。

- CLA 签署 (other): 作者需完成 CLA 签署流程。

# 风险与影响

- 风险：风险低：仅新增一个启动脚本，不影响任何现有逻辑。但需注意脚本中的并行配置可能因硬件环境不同而需调整，且依赖版本号需与目标环境匹配。
- 影响：对用户：为 Ascend NPU 用户提供了开箱即用的 Qwen3-VL-30B 训练入口；对系统：无影响；对团队：与其他 Megatron 脚本一致，维护成本低。
- 风险标记：缺少测试覆盖 , 仅新增脚本

# 关联脉络

- PR #6318 [megatron, cfg] feat: add Qwen3.5-35B Megatron-Bridge launch script on Ascend: 类似的 Megatron 启动脚本添加 PR，属于同一功能线。
- PR #6323 [veomni] feat: add veomni qwen3-30b and fix ep: 为 Qwen3-30B 添加 VeOmni 启动脚本，与本 PR 目标架构不同但模型家族相似。
- PR #5275 [veomni] feat: Add GRPO training scripts for Qwen3-VL-30B-MOE (VeOmni Backends): 先前为同一模型添加 VeOmni 后端脚本，本 PR 补充 Megatron 后端。