Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-18

#2100 Remove bshd support

原始 PR · 作者 zhuzilin · 合并时间 2026-06-18 12:11

重构 重要性 8.12 洞察度 6.00

去除 bshd 数据布局支持,统一使用 THD 格式

值得精读。该 PR 展示了如何通过移除冗余布局来简化核心管线,对理解 slime 的数据布局与上下文并行实现有较大帮助。

2026-06-17
重构 重要性 9.18 洞察度 7.00

用消息树 TrajectoryManager 替换分段轨迹,新增可插拔 harness 层

强烈建议精读:设计中消息树模型和 token drift 处理是核心创新点;review 中的性能讨论(chunk 比较、dict 比较)和设计权衡(fork vs replace)有很高的学习价值。对于需要扩展新的 LLM agent 或改进多轮 RL 训练的项目,此 PR 提供了可复用的模式。

#2093 Support GLM-5.2

原始 PR · 作者 zhuzilin · 合并时间 2026-06-17 07:04

功能 重要性 6.30 洞察度 5.00

新增 GLM-5.2 744B-A40B 模型训练支持

该 PR 是典型的模型接入变更,核心逻辑改动集中在路由和配置,适合作为 DSA 系列模型接入的参考示例。建议阅读 `slime/backends/megatron_utils/megatron_to_hf/__init__.py` 的分支扩展方式和 `slime_plugins/models/glm5/glm5.py` 中的 pipeline 分割校验逻辑。

2026-06-16

#2088 Add rollout_data_transport nixl

原始 PR · 作者 zhuzilin · 合并时间 2026-06-16 14:05

功能 重要性 7.69 洞察度 6.00

新增 rollout 数据 NIXL 传输支持

值得精读的实现包括:_tensorize_rollout_data_for_training 中对多模态数据的递归处理、actor.py 中 non_blocking 传输的改造以及 ray.put 条件分支。建议在合并后一段时间内监控 object-store 路径的稳定性,并在后续 PR 中补齐 nixl 的测试覆盖率。

#2087 Fix CI badge

原始 PR · 作者 zhuzilin · 合并时间 2026-06-16 10:17

文档 重要性 1.70 洞察度 2.00

修复 README 中 CI Badge 链接

无需深入阅读,属于常规文档维护。

#2086 Add ci badge to readme

原始 PR · 作者 zhuzilin · 合并时间 2026-06-16 10:11

文档 重要性 1.20 洞察度 1.00

README 新增 CI 徽章

简单文档改进,可直接合并。若希望长期有效,建议将徽章链接从 PR 检查页面改为指向默认分支的 CI 状态。

2026-06-15
性能优化 重要性 7.62 洞察度 6.00

数据加载与 sglang 引擎初始化重叠以缩短启动时间

值得精读:该 PR 通过 fork-join 模式将 I/O 类加载与 GPU 引擎初始化重叠,是一个经典的启动优化案例。关注其如何保持 EPD 依赖同步而仅延迟最终 `ray.get`。

功能 重要性 7.19 洞察度 5.00

新增 CISPO 优势估计器,保留裁剪 token 的梯度

值得精读。实现简洁,与现有架构无缝集成,是研究 RL 损失裁剪策略的优秀示例。关注点:stop-gradient 的写法、配置警告的用法、测试的梯度路由验证方法。

参与讨论