新增 Ascend CANN 9.0.0 的 verl v0.8.0 镜像配置
常规发布支持 PR,无需精读。但可注意两点:1)版本号自动化检查防范人为错误;2)同步更新文档和 CI 是良好实践。
verl: Volcano Engine Reinforcement Learning for LLMs
新增 Ascend CANN 9.0.0 的 verl v0.8.0 镜像配置
常规发布支持 PR,无需精读。但可注意两点:1)版本号自动化检查防范人为错误;2)同步更新文档和 CI 是良好实践。
调整 HF config 写入顺序修复 Megatron bridge 断点分片推断
值得精读的 bugfix 示例:展示了如何通过调整顺序解决隐式依赖问题,并暴露了分布式环境下容易被忽视的竞态条件。虽然改动量小,但 root cause 分析和修复方式值得参考。建议在类似多阶段写入场景中注意资源读取的时序依赖。
增大 CI 容器共享内存至 64g
简单基础设施修复,无需精读。
默认启用 V1 PPO trainer,修正配置键名与奖励计算填充
建议所有开发者关注此 PR 的变更细节,特别是配置键名修改和参考策略引用修正。对于自定义 trainer 的项目,需检查 `CriticConfig` 字段重命名。讨论中的 temperature 冗余问题建议在后续 PR 中统一清理。
原始 PR · 作者 zhouhengan1211 · 合并时间 2026-06-24 14:45
更新Ascend性能分析文档,配置示例由YAML改为Bash命令格式
纯文档更新,无需深度精读。开发者可关注本PR中配置示例格式的演变,了解verl项目对Ascend平台配置方式的偏好变化。
添加 verl 扩展指南文档,介绍自定义组件的方法
值得所有希望扩展 verl 的研究人员和开发者阅读,尤其是 Agent Loop 和 Replay Buffer 的自定义示例。建议在后续 PR 中及时更新文档以匹配实际代码接口。
为 Qwen3VL VeOmni 示例关闭 enforce_eager 以启用图模式
该 PR 变更简单直接,不建议精读。但可作为示例脚本配置调整的参考,了解 `enforce_eager` 参数对图形模式的影响。
实现 V1 PPO 训练器共置奖励模型评分
值得精读,特别是 `_compute_reward_colocate` 的实现和注意力掩码的构建方式,展示了如何在 PPO 训练器中集成共置奖励模型。对应的单元测试设计也值得参考。团队成员应了解 separate_async 模式的限制。
参与讨论