Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-25
基础设施 重要性 5.22 洞察度 2.00

新增 Ascend CANN 9.0.0 的 verl v0.8.0 镜像配置

常规发布支持 PR,无需精读。但可注意两点:1)版本号自动化检查防范人为错误;2)同步更新文档和 CI 是良好实践。

缺陷修复 重要性 6.00 洞察度 5.00

调整 HF config 写入顺序修复 Megatron bridge 断点分片推断

值得精读的 bugfix 示例:展示了如何通过调整顺序解决隐式依赖问题,并暴露了分布式环境下容易被忽视的竞态条件。虽然改动量小,但 root cause 分析和修复方式值得参考。建议在类似多阶段写入场景中注意资源读取的时序依赖。

2026-06-24
重构 重要性 6.81 洞察度 6.00

默认启用 V1 PPO trainer,修正配置键名与奖励计算填充

建议所有开发者关注此 PR 的变更细节,特别是配置键名修改和参考策略引用修正。对于自定义 trainer 的项目,需检查 `CriticConfig` 字段重命名。讨论中的 temperature 冗余问题建议在后续 PR 中统一清理。

doc 重要性 3.62 洞察度 2.00

更新Ascend性能分析文档,配置示例由YAML改为Bash命令格式

纯文档更新,无需深度精读。开发者可关注本PR中配置示例格式的演变,了解verl项目对Ascend平台配置方式的偏好变化。

2026-06-23

#6825 [doc] chore: add verl extension guide

原始 PR · 作者 wuxibin89 · 合并时间 2026-06-23 21:30

文档 重要性 4.73 洞察度 3.00

添加 verl 扩展指南文档,介绍自定义组件的方法

值得所有希望扩展 verl 的研究人员和开发者阅读,尤其是 Agent Loop 和 Replay Buffer 的自定义示例。建议在后续 PR 中及时更新文档以匹配实际代码接口。

缺陷修复 重要性 2.34 洞察度 2.00

为 Qwen3VL VeOmni 示例关闭 enforce_eager 以启用图模式

该 PR 变更简单直接,不建议精读。但可作为示例脚本配置调整的参考,了解 `enforce_eager` 参数对图形模式的影响。

功能 重要性 8.21 洞察度 6.00

实现 V1 PPO 训练器共置奖励模型评分

值得精读,特别是 `_compute_reward_colocate` 的实现和注意力掩码的构建方式,展示了如何在 PPO 训练器中集成共置奖励模型。对应的单元测试设计也值得参考。团队成员应了解 separate_async 模式的限制。

参与讨论