Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-23
重构 重要性 8.36 洞察度 7.00

通过按模型隔离重构 NPU 补丁,避免单模型缺失导致全部补丁失效

该 PR 值得精读,特别是注册表+延迟导入的错误隔离模式,对需要加载多个可选模块的场景有参考意义。建议关注其后续是否添加 rank 0 日志控制。

功能 重要性 8.74 洞察度 7.00

为 vLLM rollout 和 reward model 增加完全确定性支持,实现端到端可重现训练

该 PR 值得精读,尤其是以下几点设计决策:1)确定性路由使用 `hash(request_id)` 而非 random 选择,确保跨运行时一致;2)以 priority 作为 request_id 的基础,避免 `uuid4()` 引入的随机性;3)RM 序列化作为 vLLM classify 路径不支持的妥协方案。建议团队在文档中明确说明确定性训练的限制(仅 single-turn Agent Loop、RM max_num_seqs=1、性能开销大),并在启用时使用专用的配置 profile。

2026-06-22
功能 重要性 9.36 洞察度 7.00

Continuous Token 多轮令牌持续化机制

值得精读。该 PR 是精心设计的架构演进,展示了如何优雅地处理多模型家族下的 tokenization 通用性。关键设计亮点包括:Builder 钩子模式、模型家族自动推断、两层验证检查器。建议在后续多模态支持和默认启用后再深入评估与旧路径一致性。

缺陷修复 重要性 6.64 洞察度 5.00

修复 fully async trainer 指标日志偏移

该 PR 值得合并,修正了指标日志偏移问题。建议关注 Gemini 机器人的评论,确认 `_fit_postprocess_step` 是否真正负责指标聚合,必要时可后续调整调用顺序或增加单元测试覆盖指标日志逻辑。

功能 重要性 5.18 洞察度 4.00

新增 Ascend Qwen3.5-122B 长序列 GRPO 启动脚本

对于需要在大规模 Ascend 集群上运行 Qwen3.5-122B GRPO 训练的开发者,可直接参考此脚本进行调整。脚本中的环境标志和并行配置值得学习。

参与讨论