修复 TRTLLM rollout 非 VLM 模型部分加载逻辑,从禁用改为启用。
建议相关工程师阅读此 PR,以理解 TRTLLM rollout 部分加载逻辑的修正,特别是涉及异步处理的设计决策,有助于在类似场景中避免错误。
verl: Volcano Engine Reinforcement Learning for LLMs
修复 TRTLLM rollout 非 VLM 模型部分加载逻辑,从禁用改为启用。
建议相关工程师阅读此 PR,以理解 TRTLLM rollout 部分加载逻辑的修正,特别是涉及异步处理的设计决策,有助于在类似场景中避免错误。
原始 PR · 作者 JacobHelwig · 合并时间 2026-03-26 11:52
添加教师模型colocate模式,支持在rollout后计算教师logprobs。
建议技术管理者和工程师精读此PR,特别关注教师logprobs计算路径的设计决策,如stream_teacher_with_rollout标志的使用和批处理实现。同时,检查review中指出的bug是否已在提交历史中妥善解决,并评估测试覆盖是否充分。
废弃legacy FSDP和Megatron workers,默认启用新engine workers实现。
建议工程师精读此PR,以理解legacy workers的弃用策略和新engine workers的设计。重点关注`verl/trainer/main_ppo.py`中的动态导入逻辑,以及`verl/workers/engine/`目录下对value模型的支持增强,这些是架构迁移的关键决策点。同时注意review中未解决的deprecated消息问题,可在未来PR中修复。
优化NPU CI流水线,移除依赖安装并添加本地镜像配置以提升执行速度。
建议快速浏览此PR,重点关注镜像配置的添加和安装命令的变更,以理解CI优化策略。对于工程师,应注意到文档中的隐含假设,并在需要时手动安装依赖;对于技术管理者,此变更体现了CI性能优化的常见做法,但需监控风险。
原始 PR · 作者 FrankHo-Hwc · 合并时间 2026-03-25 19:32
修复 LoRA 模型合并器中字符串 task_type 导致的 AttributeError。
该 PR 值得精读,因为它展示了在兼容性修复中如何处理类型检查和错误处理,尤其关注 review 反馈对 falsy 值行为的讨论,这对于类似场景的设计决策有参考价值。
修复 NPU 依赖缺失并调整检查点引擎参数以解决大权重错误。
建议快速浏览此 PR,关注依赖更新和参数调整的合理性。对于工程师,值得注意 review 中提到的修复不完整性问题,考虑是否需扩展修复到其他 NPU 脚本。
原始 PR · 作者 JacobHelwig · 合并时间 2026-03-25 10:14
重构教师模型对数概率计算,移动至专用管理器以提升模块化。
建议技术管理者和工程师精读此PR,关注设计决策如分离关注点、处理循环依赖和初始化顺序修复。重点关注verl/experimental/teacher_loop/teacher_manager.py中新类的实现,以及agent_loop.py中的修改逻辑,以理解重构带来的模块化改进和潜在风险。
原始 PR · 作者 vermouth1992 · 合并时间 2026-03-25 10:10
修复了 megatron_utils.py 中的循环导入问题,优化 CI 测试。
PR 变更简单,值得快速浏览以了解循环导入修复模式。设计决策使用局部导入避免依赖循环,可作为类似场景的参考。
参与讨论