新增 fanout 端到端测试,验证单 prompt 变长多样本训练链路
值得阅读以理解 slime 中 'compact rollout' 模式的设计约束和集成方式。特别是 `rollout_id` 共享对 step splitter、reducer、loss aggregation 的影响。
slime is an LLM post-training framework for RL Scaling.
新增 fanout 端到端测试,验证单 prompt 变长多样本训练链路
值得阅读以理解 slime 中 'compact rollout' 模式的设计约束和集成方式。特别是 `rollout_id` 共享对 step splitter、reducer、loss aggregation 的影响。
新增 GPU 放置位置验证,修复启动时 IndexError
建议快速合入并同步关联 Issue #1896 关闭。该 PR 设计简洁,验证逻辑独立可测试,是良好的防御性编程例证,值得阅读。
在 main 分支 push 时自动运行 CPU 单元测试
该 PR 是基础设施优化,值得关注 CI 配置最佳实践。建议合并。
新增 Sample 序列化和规则打分器 CPU 单元测试
建议阅读 `tests/test_sample.py` 和 `tests/test_rm_math.py`,其测试组织结构(清晰分离 round-trip 合约、边界值参数化、手算期望值)可作为编写同类单元测试的参考。其余测试文件按需精读。
支持动态全局batch大小,重构调度与报告聚合
该PR是支持动态batch size的关键环节,设计巧妙(pack-first-distribute-second),测试完备(涵盖报告不变性和梯度CP不变性)。推荐架构师和核心开发精读 `cp_utils.py` 中的指标聚合设计,以及 `dp_schedule.py` 中的调度策略。测试代码也值得作为集成测试范本。
原始 PR · 作者 leofan-lab · 合并时间 2026-05-23 16:42
修复 debug-train-only 模式下 spec metrics 读取失败 bug
建议立即合并。这是一个低风险、高价值的 bugfix,修复了文档中明确推荐的调试模式中的崩溃问题。虽然改动微小,但解决了实际痛点,值得注意其防御性编程模式(使用 `getattr` 处理可选命令行参数)。
支持训练过程中动态变化的全局 batch size
值得精读,尤其关注 loss scaling 和 LR increment 的传递链路;对于参与训练核心开发的同学,理解 `global_batch_sizes` 的引入意图对后续合入 uneven-DP 特性很有帮助。
原始 PR · 作者 lilei199908 · 合并时间 2026-05-21 16:13
调换配置项赋值顺序以节省主机内存
建议融合,修复明确,改动极小。可作为配置逻辑正确性的教学案例。
参与讨论