Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 15:26 同步状态:空闲 下次计划:2026-09-01 16:26
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-28
缺陷修复 重要性 3.97 洞察度 5.00

清理 Ascend NPU 测试脚本中过时的 enable_chunked_prefill=False 配置,修复 CI 失败。

**推荐精读**。虽然变更简单,但它是系列修复(#7508 -> #7632 -> #7584)中的关键一环,清晰地展示了如何处理因上游 bug 修复而暴露的配置债务。对于维护多平台(尤其是像 Ascend NPU 这样的特定硬件后端)的大型项目,这种清理工作的方法论值得借鉴。

2026-08-27

#7562 [data] fix: offload multimodal dataset processing

原始 PR · 作者 YZJF · 合并时间 2026-08-27 17:34

缺陷修复 重要性 6.10 洞察度 6.00

多模态处理改异步卸载,提升事件循环响应

该 PR 改动简洁且聚焦,值得精读。关注 run_in_executor 的使用模式以及在异步环境中卸载 CPU 密集任务的设计,可作为类似场景的参考。可结合 #6789 和 #6804 了解完整的多模态处理异步化演进。

缺陷修复 重要性 6.90 洞察度 6.00

动态 micro-batch 强制 max_token_len 上限

值得精读。这是对训练显存控制核心逻辑的修正,关键设计是“用循环提高 micro-batch 数并重切分”与“先 all_reduce 再抛错防止死锁”,以及把约束错误从 assert 升级为显式 ValueError。建议关注 while 循环在最坏情况下的收敛性,以及 DP 间同步条件下强制组与 micro-batch 数的兼容性边界。

缺陷修复 重要性 4.99 洞察度 5.00

统一进程组初始化后端为 cpu:gloo+设备后端

该 PR 值得精读,作为理解 veril 分布式初始化 back-end 处理的一个好例子。建议关注以下几点:1. 分离后端字符串的构造方式,以及如何将 CPU 操作显式路由到 Gloo。2. 如何通过对齐 ray 版本实现一致性,体现了代码复用和一致性设计。

缺陷修复 重要性 4.35 洞察度 3.00

修复 rollout 工作节点 NCCL_CUMEM_ENABLE 被强制覆盖问题

此 PR 值得快速浏览,因为它在不经意间暴露了 verl 在环境变量处理上的一个设计倾向:硬编码默认值可能覆盖用户意图。对于使用 CUDA 并有特殊 NCCL 配置需求的用户,建议关注此改动;建议未来类似环境变量处理统一使用 os.environ.get 模式。

2026-08-26

#7549 [ci] chore: correct step naming for Ascend ci

原始 PR · 作者 lxb007981 · 合并时间 2026-08-26 09:40

基础设施 重要性 3.50 洞察度 3.00

修正 Ascend CI 步骤命名并禁用检查点保存

该 PR 属于低风险基础设施维护,建议快速合入。对于关注 CI 效率和可观测性的团队,值得了解 SAVE_FREQ=-1 在夜间任务中的使用方式。无需深度精读。

2026-08-25
重构 重要性 5.77 洞察度 3.00

移除失效 grad_offload 配置,属 Breaking 清理

值得快速阅读(约 15 分钟),重点关注两点:一是 `verl/workers/config/engine.py` 如何通过 dataclass + 生成配置联动维护配置契约,二是本 PR 与 #7536/#7466 形成的“清理死配置键”模式。如果有外部 Megatron 脚本或自定义配置,需要检查是否引用 `grad_offload` 并完成迁移。实现本身较机械,不需要深读。

参与讨论