Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-05-20
性能优化 重要性 9.13 洞察度 6.00

将微批次调度从训练侧移至rollout侧,全局优化bin packing。

值得精读,特别是 `slime/utils/dp_schedule.py` 的设计思路和 `tests/test_dp_schedule.py` 中不变量断言。需要关注: - 如何将纯逻辑从框架依赖中拆解出来(纯函数 + CPU 测试)。 - `expand_bins_by_splitting` 如何保持 bin 容量约束。 - 统一 static 和 dynamic 路径的 `micro_batch_indices` 数据契约。

2026-05-19

#1924 Reduce host memory with upgraded tms

原始 PR · 作者 zhuzilin · 合并时间 2026-05-19 21:19

性能优化 重要性 6.88 洞察度 4.00

升级 torch_memory_saver 减少主机内存占用

推荐精读,特别是 megatron.patch 中如何通过 TMS 的 region 替换现有缓冲区分配逻辑、以及 disable_grad_buffers_cpu_backup 与 nccl_ub 的互斥设计。该 PR 展示了深度集成第三方内存管理库以优化训练内存的典型模式。

#1921 Add example for streaming output

原始 PR · 作者 zhuzilin · 合并时间 2026-05-19 10:13

功能 重要性 7.63 洞察度 5.00

新增流式生成示例,支持 abort 时保留部分状态

建议阅读 `slime/rollout/sglang_streaming_rollout.py` 中基于 base snapshot + chunk delta 的增量状态累加设计,该模式在需要中断恢复的场景下值得推广。

2026-05-18

#1920 Move fully_async example to main codebase

原始 PR · 作者 zhuzilin · 合并时间 2026-05-18 19:46

功能 重要性 9.00 洞察度 5.00

将 fully_async rollout 从示例迁移至主代码库,新增 slime.rollout.fully_async_rollout 模块

值得精读,展示了如何将实验性代码正式合入主库的标准化流程:代码迁移、类型标注增强、测试配套、文档更新、CI 集成。其中全局 worker 单例和 ABORTED 样本重定向的设计值得借鉴。

#1919 add critic wandb config

原始 PR · 作者 lilei199908 · 合并时间 2026-05-18 18:55

功能 重要性 6.80 洞察度 4.00

为 critic 角色添加独立的 W&B 配置记录

此 PR 代码清晰,改动集中,无显著风险。推荐合并后同步更新用户文档,说明 W&B 配置记录的变更。

#1916 [docker] update torch memory saver

原始 PR · 作者 zhuzilin · 合并时间 2026-05-18 12:15

基础设施 重要性 2.07 洞察度 1.00

更新 Docker 中 torch_memory_saver 版本

简单依赖升级,可快速合并。建议关注该版本更新带来的功能变化。

2026-05-11
缺陷修复 重要性 6.58 洞察度 5.00

加固 retool 多轮 rollout,防止样本状态不同步

建议使用 retool 的团队立即合并此 PR,并关注 ABORTED 样本率的监控指标。该 PR 的设计思路(在关键点维护数据不变量并优先安全中止而非静默错误)值得在其他自定义 rollout 生成函数中借鉴。

缺陷修复 重要性 7.62 洞察度 6.00

将 Megatron TP 梯度归约从单一大 buffer 改为分块 all-reduce,避免大模型下 OOM

建议精读此 PR,尤其是 `_split_into_chunks` 贪心分块策略、`_grad_attr` 和 `_fsdp_flag` 的跨版本兼容写法,以及 monkey-patch 嵌入方式。这些设计模式可复用于其他 Megatron 内部函数修补场景。

参与讨论