执行摘要
- 一句话:新增Qwen3-VL-30B-MOE的VeOmni GRPO训练脚本
- 推荐动作:值得精读,特别是 VeOmni 后端用户。注意根据实际硬件调整
max_model_len 和并行配置。脚本结构清晰,可作为自定义训练任务的起点。
功能与动机
PR body: Add NPU/GPU GRPO training scripts for Qwen3-VL-30B-MOE (VeOmni backends). 目的是扩展VeOmni后端对MoE视觉语言模型的支持。
实现拆解
- 新增训练脚本
examples/grpo_trainer/run_qwen3_vl_30b_moe_veomni.sh:包含完整的GRPO训练参数配置,特别添加了 ACTOR_VEOMNI_CONFIG 和 REF_VEOMNI_CONFIG 区块,支持参数/优化器卸载、全分片、序列并行(Ulysses)、专家并行以及注意力实现选择(veomni_flash_attention_2_with_sp)和 MoE 实现(fused)。通过环境变量或直接修改变量调整超参数。
- 更新示例文档
examples/grpo_trainer/README.md:在模型支持表格中为 Qwen3-VL-30B-A3B 和 Qwen3-30B-A3B 增加 VeOmni 后端标记。
- 更新算法支持表
docs/ascend_tutorial/model_support/model_and_algorithm_support.md:在末尾新增三行记录,分别是 Qwen3-1.7B、Qwen3-30B-A3B 和 Qwen3-VL-30B-A3B-Instruct,均使用 VeOmni 后端,并给出示例脚本链接和硬件信息。
关键文件:
examples/grpo_trainer/run_qwen3_vl_30b_moe_veomni.sh(模块 示例脚本;类别 other;类型 entrypoint): 核心新增脚本,包含VeOmni后端训练配置与启动逻辑。
examples/grpo_trainer/README.md(模块 示例脚本;类别 docs;类型 documentation): 更新模型支持列表,标明VeOmni后端。
docs/ascend_tutorial/model_support/model_and_algorithm_support.md(模块 文档;类别 docs;类型 documentation): 在算法支持表中新增三条使用VeOmni后端的模型记录。
关键符号:未识别
评论区精华
风险与影响
- 风险:
- 安全风险:尽管已移除
$@,脚本仍允许通过环境变量大量覆盖配置,用户需警惕来源不明的参数设置。
- 配置错误:若用户未根据硬件调整
max_model_len 和并行大小,可能导致训练失败或性能损失。
- 重复参数风险:脚本中曾出现重复配置,虽已修复,但类似问题可能再次发生,需持续 review。
- 缺少测试覆盖:脚本为示例性质,未提供单元或集成测试,用户需自行验证正确性。
- 影响:
- 用户:提供了开箱即用的 VeOmni 训练示例,降低用户使用门槛,尤其帮助用户在 Ascend NPU 上快速启动 GRPO 训练。
- 系统:新增脚本作为官方示例,需与 VeOmni 后端版本保持同步,增加维护成本。
- 团队:需要后续持续跟进 VeOmni 的更新并更新文档及脚本。
- 风险标记:安全风险-参数注入, 配置错误-max_model_len, 重复参数, 缺少测试覆盖
关联脉络
参与讨论