迁移 NPU CI 测试至 A3 机型并增强设备兼容
值得 PR 审核者重点审阅 `device.py` 的容错设计,其余为常规基础设施搬迁移。建议 merge 后观察 CI 运行状态。
verl: Volcano Engine Reinforcement Learning for LLMs
迁移 NPU CI 测试至 A3 机型并增强设备兼容
值得 PR 审核者重点审阅 `device.py` 的容错设计,其余为常规基础设施搬迁移。建议 merge 后观察 CI 运行状态。
修复训练模式上下文切换中冗余的GPU加载和垃圾回收,提升FSDP2训练性能。
该PR值得精读,尤其对于关注训练性能优化的工程师。关键设计决策在于精准识别冗余操作的触发条件(进入GPU模式且未启用卸载),并通过最小化代码变更实现显著性能提升。建议结合PR body中的性能数据理解其实际收益。
原始 PR · 作者 Shangwei-Li · 合并时间 2026-04-21 14:07
移除分离训练器中的冗余内存快照调用,避免方法缺失错误。
该PR值得快速浏览,以了解团队如何清理过时的内存快照代码。关注点在于如何平滑迁移到新的profiler系统,避免破坏现有功能。对于涉及性能剖析或训练器开发的工程师,可参考此变更作为代码清理的范例。
原始 PR · 作者 Shangwei-Li · 合并时间 2026-04-21 11:55
修复完全异步训练器首步性能剖析标志初始化缺失问题。
该PR值得快速浏览,重点关注`fit`方法中剖析标志的初始化逻辑,以及作者对review质疑的回应(标志更新机制在`_fit_stop_profile`中)。对于完全异步训练器的开发者,可借此了解性能剖析的标志管理设计。
修正文档中数据集名称拼写错误:Hellasage → HellaSwag。
该 PR 无需精读,仅作为文档维护记录参考。对于新贡献者,可关注项目对文档准确性的重视。
为在线策略蒸馏(OPD)启用VeOmni引擎支持,扩展训练后端兼容性。
该PR值得精读,特别是对于关注训练后端扩展和蒸馏集成的工程师。值得关注的设计决策包括:1) VeOmni复用FSDP2路径的兼容性设计(基于继承关系);2) 构造函数签名对齐的修复方式,体现了对父类接口的尊重;3) 通过注释明确记录已知注意事项(如设备不匹配),提升了代码可维护性。建议结合示例脚本理解完整工作流。
原始 PR · 作者 ETOgaosion · 合并时间 2026-04-20 21:01
废弃并删除整个 verl/interactions 模块,移除环境主动控制交互流的能力。
**建议技术管理者关注此 PR,但普通工程师无需精读**。这是一个彻底的清理操作,而非新增功能。值得关注的点包括:1) 破坏性变更的决策过程,反映了架构简化的趋势;2) 移除后如何替代环境控制交互的需求;3) 与近期 Agent Loop 和 Rollout 模块演进的关联。如果团队有使用 interaction 的历史,需要评估迁移计划。
原始 PR · 作者 ETOgaosion · 合并时间 2026-04-20 21:00
废弃并删除整个 workers 模块,迁移至统一的模型引擎抽象。
该 PR 是理解项目架构演进的关键材料,值得技术管理者和核心工程师精读。重点关注: 1. **设计决策**:从分散的 worker 实现到统一引擎抽象的迁移策略,反映了项目在简化复杂性和提升模块化方面的思考。 2. **集成模式**:`ray_trainer.py` 中如何适配新引擎,特别是远程调用和错误处理模式,是分布式训练集成的典型案例。 3. **破坏性变更管理**:通过 `@deprecated` 装饰器和版本计划(v0.8.0)平滑过渡,展示了大型项目重构的最佳实践。
参与讨论