执行摘要
新增 Qwen3-VL-30B Megatron 启动脚本
支持 Qwen3-VL 视觉语言模型在 Megatron 后端上的强化学习训练,填补了该模型在 verl 中的启动脚本空白。
该 PR 值得合并,它扩展了 model 覆盖范围。建议后续补充验证结果或与现有 CI 集成。
无实质代码审查讨论。CLAassistant 自动评论要求签署 CLA。
支持 Qwen3-VL 视觉语言模型在 Megatron 后端上的强化学习训练,填补了该模型在 verl 中的启动脚本空白。
该 PR 值得合并,它扩展了 model 覆盖范围。建议后续补充验证结果或与现有 CI 集成。
无实质代码审查讨论。CLAassistant 自动评论要求签署 CLA。
examples/grpo_trainer/ 目录下新建 run_qwen3_vl_30b_a3b_megatron.sh 文件。CUDA_DEVICE_MAX_CONNECTIONS=1。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
examples/grpo_trainer/run_qwen3_vl_30b_a3b_megatron.sh |
示例脚本 | added | 3.66 |
examples/grpo_trainer/run_qwen3_vl_30b_a3b_megatron.sh
core-logic
新增的核心启动脚本,包含了完整的训练命令和依赖说明。
#!/usr/bin/env bash
# Qwen3-VL-30B MoE GRPO RL with Megatron (single node, 8 GPUs, geo3k dataset)
#
# Requirements:
# - 8 GPUs (80GB each, e.g. 1x8 H100/H200)
# - verl==release/0.7.1
# - vllm==v0.13.0
# - Megatron-LM==0.16.0
# - mbridge==0.15.1
#
# Requirements on Ascend:
# - 8 NPUs (2*64GB each, e.g. 1x8 A3)
# - verl==release/0.7.1
# - vllm==releases/v0.13.0
# - vllm-ascend==releases/v0.13.0
# - Megatron-LM==0.16.0
# - MindSpeed==0.16.0
# - mbridge==0.15.1
#
# Tested parallelism config (8 GPUs / 1 node):
# TP=4 PP=1 CP=1 EP=8 ETP=1 GEN_TP=4
#
set -x
export CUDA_DEVICE_MAX_CONNECTIONS=1 # 启用 Megatron 的通信与计算重叠
# 后续训练命令 ...
CLAassistant 自动检查提醒作者签署贡献者许可协议。
结论:作者需完成 CLA 签署流程。 · 已解决
风险低:仅新增一个启动脚本,不影响任何现有逻辑。但需注意脚本中的并行配置可能因硬件环境不同而需调整,且依赖版本号需与目标环境匹配。
对用户:为 Ascend NPU 用户提供了开箱即用的 Qwen3-VL-30B 训练入口;对系统:无影响;对团队:与其他 Megatron 脚本一致,维护成本低。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论