Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-16
缺陷修复 重要性 7.05 洞察度 6.00

修复 SGLang 权重同步时冗余 clone 导致的 OOM

值得精读。这是一个典型的“一行改动解决大问题”的 PR,展示了如何通过理解张量存储布局来避免冗余分配。`_compact_for_bucket` 函数可作为工具函数在类似场景复用。建议合并并回测 Megatron 路径(作者提到无法测试),确保不引入回归。

#6736 [trainer] feat: add off_policy metrics

原始 PR · 作者 wuxibin89 · 合并时间 2026-06-16 08:55

功能 重要性 6.87 洞察度 5.00

添加 off-policy 指标和 replay buffer 陈旧性排序

值得精读,尤其是 replay buffer 的排序策略和 off-policy 指标定义。但需注意 review 中未解决的 padding 过滤问题,若后续需要准确指标,建议合并前采用该建议。abort 重试条件放宽可能引入风险,建议评估是否加最大重试次数。

2026-06-15
功能 重要性 9.10 洞察度 6.00

添加 Tinker 分步训练 Worker 原语

值得精读,特别是其设计模式:通过类属性控制 worker 子类选择、通过上下文管理器参数控制梯度清零,展示了一种低侵入的向后兼容扩展方式。

重构 重要性 7.36 洞察度 4.00

重命名 checkpoint engine 中 trainer 参数为 actor_wg

该 PR 值得关注其清晰的变更范围和严谨的同步更新(源码 + 测试 + 文档 + README),可作为同类重命名重构的参考。对于开发者,注意更新下游代码中的关键字参数。此外,`ray.get` 在 async 方法中的问题可作技术债务记录。

2026-06-14
功能 重要性 5.57 洞察度 6.00

支持 Gemma4 多模态模型 RL 训练

值得精读。变更模式清晰体现了“能力检测优于模型名称判断”的设计原则,对于新增加多模态模型支持有参考价值。可以学习如何用 `hasattr` 替代 model name 硬编码来保持扩展性。

缺陷修复 重要性 7.21 洞察度 5.00

修复混合睡眠中 MTP drafter 权重丢失问题

值得阅读的核心是 `_sleep_hybrid` 中的配置门控条件处理方式:如何安全地从配置对象中获取可选子配置并定义门控变量。此外,测试设计中用 Mock 引擎模拟分布式环境技巧也可借鉴。建议团队成员关注此类 feature-gated 修复的防御性编程方法。

参与讨论