新增 --release-train 支持训练后释放 actor 组并重建
建议**值得精读**,特别是 `slime/ray/actor_group.py` 中 `release()` 和 `create()` 的实现思路,以及 `train.py` 中训练循环的重构。设计上将资源生命周期与训练步骤解耦,为资源弹性调度提供了参考。
slime is an LLM post-training framework for RL Scaling.
新增 --release-train 支持训练后释放 actor 组并重建
建议**值得精读**,特别是 `slime/ray/actor_group.py` 中 `release()` 和 `create()` 的实现思路,以及 `train.py` 中训练循环的重构。设计上将资源生命周期与训练步骤解耦,为资源弹性调度提供了参考。
Docker 依赖批量升级关键库
建议阅读该 PR 的 Dockerfile 变更,了解依赖版本对齐策略。可考虑在后续 PR 中补充集成测试以验证兼容性。
修复 allgather_cp 模式下 routing replay 专家对齐逻辑
建议精读 `cp_utils.py` 中新增的 `prepare_routed_experts_for_routing_replay` 函数,其展示了在 CP+TP 并行下如何对齐 rollout 与训练阶段的专家索引。该设计模式值得复用。同时关注后续是否追加测试覆盖。
更新 Docker 训练依赖,升级 FlashLinearAttention 版本
建议快速合并,是常规的依赖维护更新。
更新 SGLang patch 并增加 routed experts 校验
建议精读此 PR,尤其是 `slime/utils/types.py` 中新增的形状校验逻辑和 `sglang.patch` 中 `routed_experts_start_len` 的设计。该变更为后续 PD 场景下正确使用路由专家数据奠定了基础,值得关注其跨 PR 演进。
将 Profiling 信息合并到 Router,重构 sglang 补丁
建议仔细 review router 侧对应的 profiling 实现是否已合入,并充分测试 PD 分离场景下的 timeout 和 memory 释放逻辑。
原始 PR · 作者 nanjiangwill · 合并时间 2026-07-02 17:20
磁盘级delta权重同步,替代NCCL传输
值得精读,特别是 `disk_delta.py` 中的工具函数设计以及 `UpdateWeightFromDiskDelta` 如何通过继承复用 `UpdateWeightFromDistributed`。配置参数的变化也需关注以便兼容旧脚本。
修复 rollout_top_p 条件检查,确保非 1.0 时强制要求 token ids
小范围正确性修复,值得合并,无需精读。
参与讨论