Prhub

verl-project/verl · 标签视图

标签列表

聚合结果

grpo 相关 PR

2026-08-07
功能 重要性 7.71 洞察度 5.00

在 AMD GPU 上启用 DeepSeek-V4-Flash GRPO 训练。

值得精读。核心看点有两个:一是 `restore_moe_expert_maps` 以“布局是纯函数、就地位写回维持 CUDA graph 地址”的思路修复 RL 循环中推理引擎的隐藏状态,设计注释非常清晰;二是 refit 触发点(`update_weights_from_ipc` 的 step 1 与 `process_quanted_weights_after_loading`)的选择。阅读时建议同时核对当前 vLLM 版本中这些内部 API 是否仍然存在,并考虑补充一个 CPU 或 ROCm 冒烟测试。

2026-07-15
功能 重要性 5.85 洞察度 4.00

新增 Ascend NPU 上 Qwen3.5-35B Megatron GRPO 夜间 CI 测试

建议在后续 PR 中验证 EP 配置的正确性,或通过环境变量覆盖避免硬编码。同时可考虑将日志目录改为 `$HOME` 以提升脚本可移植性。整体而言,该 PR 作为 CI 基础设施扩展,设计简洁,适合作为同类测试的模板。

2026-07-10
功能 重要性 6.12 洞察度 4.00

添加 HY V3 Megatron GRPO 训练示例与 FLOPs 估算

该 PR 提供了实用的模型支持,值得用户参考。但应留意 `use_mbridge` 的过时问题,建议尽快为 FLOPs 估算函数补充单元测试,并在后续迭代中迁移至原生 Megatron-Bridge 配置。

2026-07-01

新增 Open-R1 多模态和 TinyLLaVA-Video 数据预处理及训练脚本

该 PR 提供了完整的多模态数据集集成范例,值得阅读和参考。特别是图像预处理中保留原始字节的方式,以及训练脚本中设备自动检测的写法。但注意奖励函数需用户自行实现,直接运行示例脚本前需创建对应的 reward score 文件。

2026-06-22
功能 重要性 5.18 洞察度 4.00

新增 Ascend Qwen3.5-122B 长序列 GRPO 启动脚本

对于需要在大规模 Ascend 集群上运行 Qwen3.5-122B GRPO 训练的开发者,可直接参考此脚本进行调整。脚本中的环境标志和并行配置值得学习。

2026-06-14
功能 重要性 5.57 洞察度 6.00

支持 Gemma4 多模态模型 RL 训练

值得精读。变更模式清晰体现了“能力检测优于模型名称判断”的设计原则,对于新增加多模态模型支持有参考价值。可以学习如何用 `hasattr` 替代 model name 硬编码来保持扩展性。

2026-06-03

#6582 [model] feat: add Qwen3.5-122B Ascend support

原始 PR · 作者 zjchenn · 合并时间 2026-06-03 16:17

功能 重要性 5.28 洞察度 5.00

支持 Qwen3.5-122B-A10B 在 Ascend NPU 上运行

该 PR 展示了多硬件场景下使用 shell 脚本进行配置分离的模式,结构清晰,但仍存在未解决的 review 问题。建议阅读以了解硬件适配方法,但在实际使用 NPU 任务前,应检查并补全缺失的 Ref 配置项和全局化公共步骤。

2026-05-19
功能 重要性 5.16 洞察度 4.00

新增 Qwen3-30B VeOmni 训练脚本并修复 EP 参数获取 bug

该 PR 值得单读以了解 VeOmni 后端训练脚本的标准结构和 EP 参数修复方式。特别注意 `extra_parallel_sizes` 初始化的一致性问题,建议在其相关 PR (#6346 等) 中确认修复。