去除 bshd 数据布局支持,统一使用 THD 格式
值得精读。该 PR 展示了如何通过移除冗余布局来简化核心管线,对理解 slime 的数据布局与上下文并行实现有较大帮助。
slime is an LLM post-training framework for RL Scaling.
去除 bshd 数据布局支持,统一使用 THD 格式
值得精读。该 PR 展示了如何通过移除冗余布局来简化核心管线,对理解 slime 的数据布局与上下文并行实现有较大帮助。
原始 PR · 作者 jingshenghang · 合并时间 2026-06-17 10:08
用消息树 TrajectoryManager 替换分段轨迹,新增可插拔 harness 层
强烈建议精读:设计中消息树模型和 token drift 处理是核心创新点;review 中的性能讨论(chunk 比较、dict 比较)和设计权衡(fork vs replace)有很高的学习价值。对于需要扩展新的 LLM agent 或改进多轮 RL 训练的项目,此 PR 提供了可复用的模式。
新增 GLM-5.2 744B-A40B 模型训练支持
该 PR 是典型的模型接入变更,核心逻辑改动集中在路由和配置,适合作为 DSA 系列模型接入的参考示例。建议阅读 `slime/backends/megatron_utils/megatron_to_hf/__init__.py` 的分支扩展方式和 `slime_plugins/models/glm5/glm5.py` 中的 pipeline 分割校验逻辑。
新增 rollout 数据 NIXL 传输支持
值得精读的实现包括:_tensorize_rollout_data_for_training 中对多模态数据的递归处理、actor.py 中 non_blocking 传输的改造以及 ray.put 条件分支。建议在合并后一段时间内监控 object-store 路径的稳定性,并在后续 PR 中补齐 nixl 的测试覆盖率。
修复 README 中 CI Badge 链接
无需深入阅读,属于常规文档维护。
README 新增 CI 徽章
简单文档改进,可直接合并。若希望长期有效,建议将徽章链接从 PR 检查页面改为指向默认分支的 CI 状态。
数据加载与 sglang 引擎初始化重叠以缩短启动时间
值得精读:该 PR 通过 fork-join 模式将 I/O 类加载与 GPU 引擎初始化重叠,是一个经典的启动优化案例。关注其如何保持 EPD 依赖同步而仅延迟最终 `ray.get`。
新增 CISPO 优势估计器,保留裁剪 token 的梯度
值得精读。实现简洁,与现有架构无缝集成,是研究 RL 损失裁剪策略的优秀示例。关注点:stop-gradient 的写法、配置警告的用法、测试的梯度路由验证方法。
参与讨论