Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-04-27

#6174 [doc] chore: fix ascend qucik start

原始 PR · 作者 wucong25 · 合并时间 2026-04-27 19:41

文档 重要性 1.35 洞察度 2.00

修正 Ascend 快速启动文档中的错误指令

此 PR 为简单的文档修复,建议快速合并。后续应关注 Issue #6142 中关于容器根目录执行的问题,可能需要补充工作目录说明或路径处理。

文档 重要性 3.48 洞察度 4.00

更新 DAPO 多模型优化实践文档

建议精读 review 评论,尤其是 `pkill -9` 和路径硬编码问题,在后续文档更新中及时修复。对于用户而言,当前版本脚本需谨慎使用,建议手动替换 `MASTER_ADDR` 并确认 `LD_PRELOAD` 路径。

缺陷修复 重要性 5.25 洞察度 5.00

修复numpy数组JSON序列化崩溃

值得精读,尤其是理解 numpy 序列化问题的通用解决模式:先尝试早期类型转换,再用 `default=str` 作为最后兜底。同时应关注 review 中指出的 `request_id` 逻辑问题,建议在后续 PR 中修复。

#6170 [vllm] chore: fix sleep_level in Ascend

原始 PR · 作者 wucong25 · 合并时间 2026-04-27 18:58

缺陷修复 重要性 4.64 洞察度 3.00

修复 Ascend NPU 上 vLLM sleep_level 导致精度问题

建议阅读 review 评论了解潜在不完修复风险。如果团队使用 Ascend NPU 且开启 EP,此变更必要但可能不充分,需进一步验证 `ServerAdapter` 行为。

向 separation 和 one-step-off 训练器扩展钩子配置

建议合并。这是一项良好的架构扩展,将 #5718 引入的插件机制推广到其他训练器,减少了未来维护时的不一致性。但建议 fix 评论中提到的配置空值问题(或创建后续追踪 Issue),并考虑为 `fully_async_policy` 路径也做类似扩展(PR body 中已提及可作为后续步骤)。

缺陷修复 重要性 7.61 洞察度 6.00

连接 sum_pi_squared 以修复 optimal_token_baseline advantage estimator 的运行时崩溃

该 PR 是典型的“功能连接”式 bugfix,展示了如何从配置到引擎再到训练器完整地贯通一个张量。尤其值得关注的是 Megatron TP 下非破坏性实现的设计权衡。对于需要自定义 advantage 估计的开发者,这是一个很好的参考模板。

其他 重要性 2.88 洞察度 3.00

更新DAPO多模型优化实践文档

无需精读,该PR仅为文档维护更新。可作为教程维护的参考示例,特别是版本更新与review中关于可重现性的一致性检查值得注意。

参与讨论