Prhub

verl-project/verl

verl: Volcano Engine Reinforcement Learning for LLMs

监控状态:已开启 最近同步:2026-09-01 18:49 同步状态:空闲 下次计划:2026-09-01 19:49

PR 列表

更多筛选
2026-05-06
功能 重要性 7.67 洞察度 5.00

实现完全异步模式多教师在线策略蒸馏

建议关注以下方面: - **资源池设计**:当前在 rollouter 中分配教师资源池,但未来规划中 rollouter 将不再负责资源分配。关注后续 PR 对资源池分离的重构。 - **蒸馏配置传递**:`distillation_config` 参数的风险需要验证 worker 类是否兼容。建议在合并后运行全量 CI 确认无 TypeError。 - **异步兼容性**:`run_in_executor` 的使用是临时方案,需跟踪 `MultiTeacherModelManager` 的异步化进展。 - **测试覆盖**:如果使用 FSDP 或其他后端,考虑扩展测试矩阵。

缺陷修复 重要性 5.56 洞察度 3.00

修复 reward model 并行度计算偏差

该 PR 为明确的 bugfix,变更量小、逻辑清晰,值得快速审阅合并。建议确认是否有必要添加单元测试或集成测试覆盖 DP > 1 和 PP > 1 的场景,以防止未来回归。

缺陷修复 重要性 6.68 洞察度 5.00

修复验证阶段多输出 dump 缺失问题

建议在排序前增加防御性处理,例如对 `parts[1]` 和 `parts[2]` 进行格式验证,或使用 try-except 避免异常崩溃。该 PR 的设计思路(分别获取所有输出和最终元数据)值得学习,但需要在健壮性上做补强。

缺陷修复 重要性 7.46 洞察度 5.00

修复Megatron CP+TP序列对齐与新MTP API适配

该PR修复了重要的并行对齐bug并适配了新API,值得对Megatron引擎开发者和经验丰富的用户精读。关键设计决策:使用条件导入实现API版本兼容,以及对齐公式背后的推导逻辑(乘积而非lcm)值得记录。建议为修改的路径补充示例或测试。

缺陷修复 重要性 5.56 洞察度 3.00

修复 NPU 兼容性:移除 is_cuda_available 检查

值得快速合入。这是针对 NPU 兼容性的微小修复,设计清晰,review 讨论中的担忧已被作者有理有据地驳回。无需深度精读,但对于了解 veRL 如何在不同加速器(CUDA/NPU)间切换设备抽象层有一定参考意义。

参与讨论