同步内部代码,新增 Megatron Teacher Server 及无状态 Adam
建议重点关注 Teacher Server 的架构设计(尤其是高效采样算法和无状态 Adam),可为后续类似组件提供参考。对于使用 teacher-forcing 的场景,此 PR 提供了一套完整的参考实现。
slime is an LLM post-training framework for RL Scaling.
同步内部代码,新增 Megatron Teacher Server 及无状态 Adam
建议重点关注 Teacher Server 的架构设计(尤其是高效采样算法和无状态 Adam),可为后续类似组件提供参考。对于使用 teacher-forcing 的场景,此 PR 提供了一套完整的参考实现。
README 新增 Dressage 框架介绍
该 PR 为简单的文档更新,无需深入审查。建议合并,以完善生态系统文档。
增强 append_response_tokens 的校验与元数据一致性
值得精读,特别是其防御式编程风格和统一元数据校验的设计思路。对比 #2108 的抽取,本 PR 进一步完善了接口契约。对于维护训练管道的工程师,建议检查所有 `append_response_tokens` 调用点是否满足新校验要求。
将 response token 追加逻辑提取至 Sample 类
该 PR 值得精读,展示了如何将引擎相关数据处理逻辑抽象到数据模型层(Sample 类),使上层 rollout 解耦。特别关注其 Tensor 化设计和 `decode_int32_meta_array` 的鲁棒性。对于开发新 rollout 的团队是参考范例。
修复 SGLang RouterArgs 注册遗漏
变更微小且修复明确,可快速合入。建议开发者检查 `sglang_router` 库版本是否为预期版本(参考 Dockerfile 或 `sglang` 依赖),避免因库接口变化引入新的不兼容。
修复 tau-bench 配置键名不匹配问题
可直接合并。少量改动但修复了实际存在的 bug,建议在发布说明中提及。
新增 top_p 掩码支持提升 RL 训练准确性
该 PR 设计清晰,值得关注其在分布式训练中传递辅助数据的方法。建议阅读 `_build_topp_keep_mask` 和 `compute_log_probs` 的改动,理解如何与 TP/CP 对齐。
删除失效的 Dr.GRPO 自定义 reducer 示例引用
无需精读。对于使用自定义 PG loss reducer 的用户,后续可关注 PR #2090 提供的内置 `--loss-aggregation constant` 选项。
参与讨论