Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-06-29

#2144 perf: fuse PPO logprob entropy computation

原始 PR · 作者 zhuzilin · 合并时间 2026-06-29 16:08

性能优化 重要性 9.00 洞察度 6.00

融合 PPO logprob/entropy 计算,减少 allreduce 一半

建议团队成员精读 `_VocabParallelLogProbEntropy` 的 autograd 实现,作为融合通信的工程模式;同时也值得检查 CI 中新增的两个测试是否运行正常,确保数值稳定性。对于需要优化 PPO 训练性能的场景,此 PR 提供了解耦可复用的参考。

#2134 fix: handle empty colocated weight buckets

原始 PR · 作者 EazyReal · 合并时间 2026-06-29 15:45

缺陷修复 重要性 7.55 洞察度 5.00

修复空 colocated weight buckets 导致 crash 的问题

该 PR 修复了一个重要的分布式同步 Bug,设计简洁且测试覆盖良好。建议合并后团队关注相关路径(`update_weight_from_tensor.py`、`update_weight_from_distributed.py`)是否存在类似假设,预防回归。同时,新增的单元测试值得作为后续类似功能的参考。

#2135 feat(gemma4): add Gemma4 dense and MoE support

原始 PR · 作者 EazyReal · 合并时间 2026-06-29 15:43

功能 重要性 9.18 洞察度 6.00

新增 Gemma4 密集型和 MoE 模型完整支持

该 PR 设计质量高,实现完整,测试覆盖全面。建议精读以下设计点:① `Gemma4Router` 中 renormalise-then-scale 的顺序决策(与 HF 一致);② `DualRotaryEmbedding` 拼接而非元组的设计理由;③ `_Gemma4LogitSoftcap` 使用 autograd Function 实现就地 softcapping;④ 通过 hook 而非子类化注入模型行为的选择。这些决策值得在其他模型支持中借鉴。

#2145 [docker] fix top_p mask speed issue

原始 PR · 作者 zhuzilin · 合并时间 2026-06-29 14:17

缺陷修复 重要性 3.85 洞察度 4.00

修复 top_p mask 性能问题

此 PR 为针对性的性能修复,改动量小且准确。建议相关人员了解该条件判断的引入原因,以便在 sglang 上游版本升级时同步。

缺陷修复 重要性 6.68 洞察度 5.00

修复 Megatron 服务器并行 update_from_disk 问题

值得精读,特别是锁和 future 的使用方式。建议在后续 PR 中补充对应的并发测试。

2026-06-23
功能 重要性 5.29 洞察度 5.00

新增 SWE_AGENT 环境变量支持选择 agent 实现

值得精读。该 PR 展示了一种简单而优雅的 agent 选择模式(注册表 + 环境变量注入),符合开闭原则,便于后续扩展。对于其他需要多后端/多实现的场景有借鉴意义。

缺陷修复 重要性 6.27 洞察度 6.00

修复 SWE coding-agent RL 稳定性问题

建议精读。PR 展示了 agent RL 训练中异常处理的最佳实践:通过 `drop_session` 分离清理与样本生成,通过 `rollout_log_probs=[0.0]` 和 `remove_sample=True` 优雅处理中止样本。测试覆盖不足,后续可补充。

#2121 Fix bug on non-float reward

原始 PR · 作者 zhuzilin · 合并时间 2026-06-23 10:45

缺陷修复 重要性 5.27 洞察度 2.00

修复非浮点型 reward 导致的 crash

建议合并。修复明确,改动安全。若需保留平均 reward 展示,应在后续 PR 中引入更健壮的类型处理,例如统一转换为 float。

参与讨论