Prhub

#6443 [megatron, cfg] feat: add Qwen3-VL-30B mbridge launch script on Ascend

原始 PR 作者 Seren-hao 合并时间 2026-05-22 21:10 文件变更 1 提交数 1 评论 1 代码增减 +23 / -0

执行摘要

新增 Qwen3-VL-30B Megatron 启动脚本

支持 Qwen3-VL 视觉语言模型在 Megatron 后端上的强化学习训练,填补了该模型在 verl 中的启动脚本空白。

该 PR 值得合并,它扩展了 model 覆盖范围。建议后续补充验证结果或与现有 CI 集成。

讨论亮点

无实质代码审查讨论。CLAassistant 自动评论要求签署 CLA。

实现拆解

  1. examples/grpo_trainer/ 目录下新建 run_qwen3_vl_30b_a3b_megatron.sh 文件。
  2. 添加 shebang 和详细的注释 header,说明环境需求(GPU/NPU)、依赖版本(vllm, Megatron-LM, mbridge 等)以及推荐的并行配置(TP=4 PP=1 CP=1 EP=8 ETP=1 GEN_TP=4)。
  3. 设置必要的环境变量如 CUDA_DEVICE_MAX_CONNECTIONS=1
  4. 该脚本提供了运行 Qwen3-VL-30B 的完整命令行模板。
文件 模块 状态 重要度
examples/grpo_trainer/run_qwen3_vl_30b_a3b_megatron.sh 示例脚本 added 3.66

关键源码片段

examples/grpo_trainer/run_qwen3_vl_30b_a3b_megatron.sh core-logic

新增的核心启动脚本,包含了完整的训练命令和依赖说明。

#!/usr/bin/env bash
# Qwen3-VL-30B MoE GRPO RL with Megatron (single node, 8 GPUs, geo3k dataset)
#
# Requirements:
# - 8 GPUs (80GB each, e.g. 1x8 H100/H200)
# - verl==release/0.7.1
# - vllm==v0.13.0
# - Megatron-LM==0.16.0
# - mbridge==0.15.1
#
# Requirements on Ascend:
# - 8 NPUs (2*64GB each, e.g. 1x8 A3)
# - verl==release/0.7.1
# - vllm==releases/v0.13.0
# - vllm-ascend==releases/v0.13.0
# - Megatron-LM==0.16.0
# - MindSpeed==0.16.0
# - mbridge==0.15.1
#
# Tested parallelism config (8 GPUs / 1 node):
# TP=4 PP=1 CP=1 EP=8 ETP=1 GEN_TP=4
#
set -x
export CUDA_DEVICE_MAX_CONNECTIONS=1 # 启用 Megatron 的通信与计算重叠
# 后续训练命令 ...

评论区精华

CLA 签署 other

CLAassistant 自动检查提醒作者签署贡献者许可协议。

结论:作者需完成 CLA 签署流程。 · 已解决

风险与影响

风险低:仅新增一个启动脚本,不影响任何现有逻辑。但需注意脚本中的并行配置可能因硬件环境不同而需调整,且依赖版本号需与目标环境匹配。

对用户:为 Ascend NPU 用户提供了开箱即用的 Qwen3-VL-30B 训练入口;对系统:无影响;对团队:与其他 Megatron 脚本一致,维护成本低。

缺少测试覆盖 仅新增脚本

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论