为fully_async训练模式新增验证生成样本的日志记录功能。
该PR值得精读,特别是review中关于样本捕获正确性的讨论,展示了在异步训练中处理分布式日志的典型模式。关注`ValidateMetrics`数据扩展和`ValidationGenerationsLogger`的使用方式。
verl: Volcano Engine Reinforcement Learning for LLMs
为fully_async训练模式新增验证生成样本的日志记录功能。
该PR值得精读,特别是review中关于样本捕获正确性的讨论,展示了在异步训练中处理分布式日志的典型模式。关注`ValidateMetrics`数据扩展和`ValidationGenerationsLogger`的使用方式。
为agent loop新增奖励计算耗时指标,用于定位训练瓶颈。
该PR值得快速浏览,可作为性能监控指标添加的参考模板。重点关注:1. simple_timer的使用模式;2. 数据类字段扩展的向后兼容设计;3. slowest样本索引的多指标聚合逻辑修正。
原始 PR · 作者 Jackie2049 · 合并时间 2026-04-13 17:32
修复 PPO 训练器指标计算中空张量导致的崩溃,返回 NaN 以优雅处理边缘情况。
建议工程师阅读此 PR 以学习如何优雅处理空张量情况,特别关注 review 中讨论的设计决策,如对 `critic/values` 的双重检查和 Agentic RL 场景的解释。
为NPU硬件新增RLOO优势估计器训练示例脚本,并合并到现有GPU脚本中。
该PR值得NPU用户或需要参考RLOO配置的工程师浏览,重点关注设备参数化设计和NPU特定覆盖的实现方式。对于技术管理者,可关注团队如何通过review优化硬件兼容性和验证频率,体现了对用户体验的考量。
原始 PR · 作者 wangshuyang31 · 合并时间 2026-04-13 15:58
为 veomni 引擎添加 NPU CI 测试
建议阅读以了解 veomni NPU CI 的配置方式,尤其是合并测试脚本的模式。对于关注 CI 基础设施和 NPU 后端的工程师,本 PR 提供了可参考的集成范例。
修复TRT-LLM rollout中engine_kwargs覆盖KvCacheConfig导致配置丢失的问题。
该PR值得精读,特别是关注配置合并的设计决策。虽然变更简单,但展示了在多层配置传递中避免覆盖的关键技巧。建议关注gemini-code-assist[bot]提出的重复键和null值处理问题,这可能在类似场景中普遍存在。
修复fully_async训练中streaming_generation异常时monitor_task无法停止的问题。
该PR值得快速浏览以了解fully_async训练模式的异常处理机制。虽然变更简单,但展示了在异步训练中正确处理异常的重要性。关注点:finally块的使用确保了资源清理,这是异步编程中的良好实践。
原始 PR · 作者 FightingZhen · 合并时间 2026-04-13 10:25
更新 Ascend 相关文件的代码所有者,将 @FightingZhen 替换为 @wucong25。
此 PR 变更简单,无需精读。对于技术管理者,可关注代码所有者调整是否反映了团队职责变化;对于工程师,无需特别关注,除非涉及相关模块的维护工作。
参与讨论