Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-02 19:36 同步状态:空闲 下次计划:2026-09-02 20:36

PR 列表

更多筛选
2026-06-18

#6446 [megatron] feat: Support Megatron chunk entropy

原始 PR · 作者 ZLiao097 · 合并时间 2026-06-18 10:40

功能 重要性 7.01 洞察度 5.00

在 Megatron 后端实现分块熵计算以降低显存峰值

值得精读,特别是分块熵在张量并行环境下的实现方式,以及如何在多个 engine 后端统一扩展配置。关注其通过配置开关优雅降级的设计,以及 review 中关于 dtype 和参数传递的问题修复。

功能 重要性 7.72 洞察度 5.00

为 Tinker 工作器添加优化器步骤参数覆盖

值得从设计层面关注的问题:为何将参数覆盖限定在 Tinker worker 层而非 engine API(保持 engine 通用性)。类型校验的严格程度(当前选择快速失败而非隐式转换)是一个典型的设计权衡。建议在集成 Tinker 工作流时注意参数类型正确性,并考虑为 Megatron 等后端补充类似的集成测试。

功能 重要性 6.09 洞察度 4.00

新增 Megatron Lite 后端示例脚本与文档

建议:对使用 Megatron Lite 进行大规模 RL 训练的团队,精读文档和启动脚本,特别是网格配置和优化器选择(fsdp2 vs dist_opt)。命名检查的修改展示了如何优雅扩展多 token 后端后缀,值得参考。

2026-06-17

#6788 [doc] fix: update OPD docs

原始 PR · 作者 Dmovic · 合并时间 2026-06-17 22:37

文档 重要性 2.46 洞察度 3.00

更新 OPD 文档的参考文献编号

该 PR 属于简单的文档清理,无需精读。但其 review 过程展示了自动化 review 工具对引用一致性的检查能力,值得注意。

feat 重要性 6.68 洞察度 5.00

修复分离异步 trainer 并启用运行

值得关注:这是分离异步训练器从 stub 变为可运行的关键一步,但功能仍不完整,建议跟进后续 PR 了解完整方案。设计中采用 `start_rank` 传递副本起始编号的做法可作参考。

参与讨论