Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-18
功能 重要性 7.81 洞察度 7.00

重构FSDP+LoRA分层召唤,降低显存并修复死锁

该 PR 值得所有深入使用 FSDP+LoRA 训练的用户精读,尤其是 `layered_summon_lora_params` 的设计思路和 wrap 策略防护逻辑。建议结合具体模型进行回归测试,验证显存与训练稳定性。对于重复 all-gather 的风险,可在升级后仍保持监控,必要时在内部 fork 中进一步优化。

#6446 [megatron] feat: Support Megatron chunk entropy

原始 PR · 作者 ZLiao097 · 合并时间 2026-06-18 10:40

功能 重要性 7.01 洞察度 5.00

在 Megatron 后端实现分块熵计算以降低显存峰值

值得精读,特别是分块熵在张量并行环境下的实现方式,以及如何在多个 engine 后端统一扩展配置。关注其通过配置开关优雅降级的设计,以及 review 中关于 dtype 和参数传递的问题修复。

功能 重要性 7.72 洞察度 5.00

为 Tinker 工作器添加优化器步骤参数覆盖

值得从设计层面关注的问题:为何将参数覆盖限定在 Tinker worker 层而非 engine API(保持 engine 通用性)。类型校验的严格程度(当前选择快速失败而非隐式转换)是一个典型的设计权衡。建议在集成 Tinker 工作流时注意参数类型正确性,并考虑为 Megatron 等后端补充类似的集成测试。

功能 重要性 6.09 洞察度 4.00

新增 Megatron Lite 后端示例脚本与文档

建议:对使用 Megatron Lite 进行大规模 RL 训练的团队,精读文档和启动脚本,特别是网格配置和优化器选择(fsdp2 vs dist_opt)。命名检查的修改展示了如何优雅扩展多 token 后端后缀,值得参考。

2026-06-17

#6788 [doc] fix: update OPD docs

原始 PR · 作者 Dmovic · 合并时间 2026-06-17 22:37

文档 重要性 2.46 洞察度 3.00

更新 OPD 文档的参考文献编号

该 PR 属于简单的文档清理,无需精读。但其 review 过程展示了自动化 review 工具对引用一致性的检查能力,值得注意。

参与讨论