#6390 [doc] chore: announce VeRL-Omni pre-release in README News
原始 PR · 作者 SamitHuang · 合并时间 2026-05-18 18:08
README 新增 VeRL-Omni 预发布新闻
变更简单明了,无技术风险。建议批准合并。
verl: Volcano Engine Reinforcement Learning for LLMs
原始 PR · 作者 SamitHuang · 合并时间 2026-05-18 18:08
README 新增 VeRL-Omni 预发布新闻
变更简单明了,无技术风险。建议批准合并。
原始 PR · 作者 Jackie2049 · 合并时间 2026-05-18 15:49
异步写入 JSONL 并传播 I/O 异常,释放训练循环
值得精读。展示了在不影响训练精度的前提下,将 I/O 异步化并正确管理资源与异常传播的实践。`_shutdown_dump_executor` 的设计(drain 所有 future 再关闭)可作为后台任务清理的标准模式。适合关注训练性能和数据可靠性的工程师。
标记 main_ppo.py 和 RayPPOTrainer 为弃用
建议合并前修正 review 中提出的问题:修正拼写错误,并将消息改为仅传递替代模块名称(如 `"verl.trainer.main_ppo_sync"`),而不是完整句子,以利用 `deprecated` 装饰器的自动格式化功能。
原始 PR · 作者 ji-huazhong · 合并时间 2026-05-18 11:43
NPU 内存 allocator 设置重构:从环境变量迁移到统一函数
建议精读此 PR,并关注其中引入的回归问题。虽然 PR 本身方向正确(统一路径),但缺少对 `TrainingWorker.__init__` 中调用 `set_expandable_segments(True)` 的补充,可能导致 NPU 上功能退化。推荐在合并后补充该调用。
原始 PR · 作者 0oshowero0 · 合并时间 2026-05-18 08:43
修复同步 Trainer 中 extra_info 合并问题并升级 TransferQueue
值得精读,特别是 `BatchData.concat` 的手动合并策略展示了如何在三方库升级(TQ v0.1.7)后处理兼容性问题。同时可学习清理调试代码和配置扩展的最佳实践。
原始 PR · 作者 xvlincaigou · 合并时间 2026-05-17 17:26
删除已废弃的 sglang_multiturn 文档引用
该 PR 是常规的文档维护,不具精读价值。但团队处理文档资产腐化的及时性值得肯定。
新增 Ascend950DT 的 FLOPS 配置
简单配置变更,无需精读。建议后续确认硬件名称字符串是否与 `get_torch_device` 或实际设备信息对齐。
原始 PR · 作者 JacobHelwig · 合并时间 2026-05-15 12:53
新增 OPD 算法文档与多教师示例脚本
建议团队尽快修复 review 中指出的教师池配置问题,避免用户踩坑。OPD 文档内容详实,可作为算法参考和用户教程。对于想了解蒸馏进阶用法的开发者,推荐精读 `docs/algo/opd.md` 中的 MOPD 和 Policy Gradient 部分。
参与讨论