Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-18
功能 重要性 8.21 洞察度 7.00

异步写入 JSONL 并传播 I/O 异常,释放训练循环

值得精读。展示了在不影响训练精度的前提下,将 I/O 异步化并正确管理资源与异常传播的实践。`_shutdown_dump_executor` 的设计(drain 所有 future 再关闭)可作为后台任务清理的标准模式。适合关注训练性能和数据可靠性的工程师。

#6384 [trainer] feat: deprecate main_ppo.py warning

原始 PR · 作者 wuxibin89 · 合并时间 2026-05-18 12:31

重构 重要性 4.83 洞察度 2.00

标记 main_ppo.py 和 RayPPOTrainer 为弃用

建议合并前修正 review 中提出的问题:修正拼写错误,并将消息改为仅传递替代模块名称(如 `"verl.trainer.main_ppo_sync"`),而不是完整句子,以利用 `deprecated` 装饰器的自动格式化功能。

重构 重要性 6.18 洞察度 5.00

NPU 内存 allocator 设置重构:从环境变量迁移到统一函数

建议精读此 PR,并关注其中引入的回归问题。虽然 PR 本身方向正确(统一路径),但缺少对 `TrainingWorker.__init__` 中调用 `set_expandable_segments(True)` 的补充,可能导致 NPU 上功能退化。推荐在合并后补充该调用。

缺陷修复 重要性 6.71 洞察度 6.00

修复同步 Trainer 中 extra_info 合并问题并升级 TransferQueue

值得精读,特别是 `BatchData.concat` 的手动合并策略展示了如何在三方库升级(TQ v0.1.7)后处理兼容性问题。同时可学习清理调试代码和配置扩展的最佳实践。

2026-05-17

#6379 [doc] fix: delete sglang_multiturn

原始 PR · 作者 xvlincaigou · 合并时间 2026-05-17 17:26

文档 重要性 2.17 洞察度 1.00

删除已废弃的 sglang_multiturn 文档引用

该 PR 是常规的文档维护,不具精读价值。但团队处理文档资产腐化的及时性值得肯定。

2026-05-16

#6363 [hardware] add DT flops

原始 PR · 作者 brook-cpp · 合并时间 2026-05-16 10:04

其他 重要性 3.94 洞察度 1.00

新增 Ascend950DT 的 FLOPS 配置

简单配置变更,无需精读。建议后续确认硬件名称字符串是否与 `get_torch_device` 或实际设备信息对齐。

2026-05-15

#6358 [doc] chore: OPD docs

原始 PR · 作者 JacobHelwig · 合并时间 2026-05-15 12:53

文档 重要性 5.08 洞察度 4.00

新增 OPD 算法文档与多教师示例脚本

建议团队尽快修复 review 中指出的教师池配置问题,避免用户踩坑。OPD 文档内容详实,可作为算法参考和用户教程。对于想了解蒸馏进阶用法的开发者,推荐精读 `docs/algo/opd.md` 中的 MOPD 和 Policy Gradient 部分。

参与讨论