融合 PPO logprob/entropy 计算,减少 allreduce 一半
建议团队成员精读 `_VocabParallelLogProbEntropy` 的 autograd 实现,作为融合通信的工程模式;同时也值得检查 CI 中新增的两个测试是否运行正常,确保数值稳定性。对于需要优化 PPO 训练性能的场景,此 PR 提供了解耦可复用的参考。
slime is an LLM post-training framework for RL Scaling.
融合 PPO logprob/entropy 计算,减少 allreduce 一半
建议团队成员精读 `_VocabParallelLogProbEntropy` 的 autograd 实现,作为融合通信的工程模式;同时也值得检查 CI 中新增的两个测试是否运行正常,确保数值稳定性。对于需要优化 PPO 训练性能的场景,此 PR 提供了解耦可复用的参考。
修复空 colocated weight buckets 导致 crash 的问题
该 PR 修复了一个重要的分布式同步 Bug,设计简洁且测试覆盖良好。建议合并后团队关注相关路径(`update_weight_from_tensor.py`、`update_weight_from_distributed.py`)是否存在类似假设,预防回归。同时,新增的单元测试值得作为后续类似功能的参考。
新增 Gemma4 密集型和 MoE 模型完整支持
该 PR 设计质量高,实现完整,测试覆盖全面。建议精读以下设计点:① `Gemma4Router` 中 renormalise-then-scale 的顺序决策(与 HF 一致);② `DualRotaryEmbedding` 拼接而非元组的设计理由;③ `_Gemma4LogitSoftcap` 使用 autograd Function 实现就地 softcapping;④ 通过 hook 而非子类化注入模型行为的选择。这些决策值得在其他模型支持中借鉴。
修复 top_p mask 性能问题
此 PR 为针对性的性能修复,改动量小且准确。建议相关人员了解该条件判断的引入原因,以便在 sglang 上游版本升级时同步。
修复 Megatron 服务器并行 update_from_disk 问题
值得精读,特别是锁和 future 的使用方式。建议在后续 PR 中补充对应的并发测试。
原始 PR · 作者 jingshenghang · 合并时间 2026-06-23 14:57
新增 SWE_AGENT 环境变量支持选择 agent 实现
值得精读。该 PR 展示了一种简单而优雅的 agent 选择模式(注册表 + 环境变量注入),符合开闭原则,便于后续扩展。对于其他需要多后端/多实现的场景有借鉴意义。
原始 PR · 作者 jingshenghang · 合并时间 2026-06-23 14:57
修复 SWE coding-agent RL 稳定性问题
建议精读。PR 展示了 agent RL 训练中异常处理的最佳实践:通过 `drop_session` 分离清理与样本生成,通过 `rollout_log_probs=[0.0]` 和 `remove_sample=True` 优雅处理中止样本。测试覆盖不足,后续可补充。
修复非浮点型 reward 导致的 crash
建议合并。修复明确,改动安全。若需保留平均 reward 展示,应在后续 PR 中引入更健壮的类型处理,例如统一转换为 float。
参与讨论