修正 Ascend 快速启动文档中的错误指令
此 PR 为简单的文档修复,建议快速合并。后续应关注 Issue #6142 中关于容器根目录执行的问题,可能需要补充工作目录说明或路径处理。
verl: Volcano Engine Reinforcement Learning for LLMs
修正 Ascend 快速启动文档中的错误指令
此 PR 为简单的文档修复,建议快速合并。后续应关注 Issue #6142 中关于容器根目录执行的问题,可能需要补充工作目录说明或路径处理。
原始 PR · 作者 ChibiQuest · 合并时间 2026-04-27 19:38
更新 DAPO 多模型优化实践文档
建议精读 review 评论,尤其是 `pkill -9` 和路径硬编码问题,在后续文档更新中及时修复。对于用户而言,当前版本脚本需谨慎使用,建议手动替换 `MASTER_ADDR` 并确认 `LD_PRELOAD` 路径。
修复numpy数组JSON序列化崩溃
值得精读,尤其是理解 numpy 序列化问题的通用解决模式:先尝试早期类型转换,再用 `default=str` 作为最后兜底。同时应关注 review 中指出的 `request_id` 逻辑问题,建议在后续 PR 中修复。
修复 Ascend NPU 上 vLLM sleep_level 导致精度问题
建议阅读 review 评论了解潜在不完修复风险。如果团队使用 Ascend NPU 且开启 EP,此变更必要但可能不充分,需进一步验证 `ServerAdapter` 行为。
原始 PR · 作者 NaomiEisen · 合并时间 2026-04-27 18:56
向 separation 和 one-step-off 训练器扩展钩子配置
建议合并。这是一项良好的架构扩展,将 #5718 引入的插件机制推广到其他训练器,减少了未来维护时的不一致性。但建议 fix 评论中提到的配置空值问题(或创建后续追踪 Issue),并考虑为 `fully_async_policy` 路径也做类似扩展(PR body 中已提及可作为后续步骤)。
原始 PR · 作者 chenjiaoAngel · 合并时间 2026-04-27 15:19
修复全异步模式下自定义奖励函数未注册问题
建议精读,并确认 `migrate_legacy_reward_impl` 的调用时机是否满足所有场景。若后续对配置检测逻辑有改动,需同步调整该调用位置。
连接 sum_pi_squared 以修复 optimal_token_baseline advantage estimator 的运行时崩溃
该 PR 是典型的“功能连接”式 bugfix,展示了如何从配置到引擎再到训练器完整地贯通一个张量。尤其值得关注的是 Megatron TP 下非破坏性实现的设计权衡。对于需要自定义 advantage 估计的开发者,这是一个很好的参考模板。
原始 PR · 作者 ChibiQuest · 合并时间 2026-04-27 13:33
更新DAPO多模型优化实践文档
无需精读,该PR仅为文档维护更新。可作为教程维护的参考示例,特别是版本更新与review中关于可重现性的一致性检查值得注意。
参与讨论