Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-07
缺陷修复 重要性 4.70 洞察度 2.00

修复 request_id 写入错误字典的问题

值得合入。该 PR 修复了一个明确的 bug,修复方式直接且正确。虽然改动小,但对依赖 `request_id` 进行下游分析的用户很重要。建议合入后关闭关联 Issue #6250。

#6260 [doc] feat: add code reviewer

原始 PR · 作者 ArronHZG · 合并时间 2026-05-07 11:00

基础设施 重要性 2.73 洞察度 3.00

更新 CODEOWNERS,新增代码审查人

该 PR 为基础设施配置变更,逻辑简单,无需精读。但可关注后续是否针对机器人建议做进一步补充完善。 值得注意的设计决策:未采纳机器人评论的建议,意味着团队接受了引擎子路径和测试路径可能不会被 @ArronHZG 自动审查的现状,可能是基于实际的 owner 分配需求或后续计划。

缺陷修复 重要性 5.56 洞察度 4.00

回滚 reward model 的 world_size 修复

建议关注后续 PR #6265 对 `RewardModelConfig` 的修复,该 PR 会为配置类添加缺失的字段,使 #6226 的正确计算可以被安全地重新应用。当前回滚是临时解决方案。

缺陷修复 重要性 5.15 洞察度 3.00

修复TRTLLM rollout的Docker镜像和CI脚本兼容性

该PR修复了紧急的兼容性问题,值得合并。但建议合并后: 1. 验证Docker构建是否成功,确认cupy和ray版本可用; 2. 检查batch_wait参数是否在TRTLLM服务端实现,若不生效则考虑移除或提交配套实现; 3. 定期清理mbridge临时补丁。

缺陷修复 重要性 6.17 洞察度 4.00

每次采集内存快照后自动清除历史记录

该 PR 修复了内存快照采集的累积 bug,改动简洁且针对性强。建议快速合入,后续可考虑增加 `context`/`stacks` 等参数的透传,以允许用户更精细地控制记录内容。

2026-05-06
功能 重要性 9.36 洞察度 7.00

SGLang Prefill-Decode 非对称分解 rollout

值得精读,尤其关注以下设计决策: 1. **非对称 TP 布局**:decode 可使用与 prefill 不同的 TP 大小,提供了灵活性。 2. **取消独立注册名**:通过 flag 而非独立名称派发,降低了用户心智负担,也简化了代码。 3. **rank-modulo 路由**:通过取模确保即使未来启用 DP>1,角色映射仍正确。 4. **TOCTOU 防护**:使用 with_alive_sock=True 避免端口被抢占。 这些设计模式对其他并行策略的实现有借鉴意义。

参与讨论