Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 17:42 同步状态:空闲 下次计划:2026-09-01 18:42

PR 列表

更多筛选
2026-07-02
功能 重要性 9.18 洞察度 7.00

SWE 评分协议可配置 + Sandbox RPC 稳健性增强

值得精读,尤其是 `exec_and_wait` 的设计模式和 `E2BSandbox._rpc_retry` 的幂等性策略;评分协议的策略模式也很清晰。建议关注截断逻辑的正确性和重试异常覆盖。

2026-07-01

#2123 Fix training stuck on all-gather cp

原始 PR · 作者 zhuzilin · 合并时间 2026-07-01 14:21

缺陷修复 重要性 6.19 洞察度 6.00

修复 all-gather CP 模式下训练卡住的问题

建议合并该 PR,它解决了严重的训练卡死问题。修改小而精确,值得精读以理解 all-gather CP 模式下梯度图构建的细节。特别是 `requires_grad` 继承和切片取代 `torch.zeros` 的做法,可作为保持计算图连续性的参考模式。

#2160 Fix CI

原始 PR · 作者 zhuzilin · 合并时间 2026-07-01 12:21

缺陷修复 重要性 4.86 洞察度 3.00

修复 CI 测试,调整梯度比对逻辑与配置

本 PR 是典型的 CI 稳定性修复,值得关注的是 `_assert_logprob_backward_close` 的设计:通过 bfloat16 对齐来规避不同 kernel 的精度差异,是一个实用的数值测试技巧。

2026-06-30

#2153 bugfix

原始 PR · 作者 zhuzilin · 合并时间 2026-06-30 18:29

缺陷修复 重要性 4.90 洞察度 3.00

将 with_entropy_grad 判断下移到 get_log_probs_and_entropy

该 PR 为简单的清理性 bugfix,不需重点精读,但体现了代码复用和职责分离的良好实践。

性能优化 重要性 6.91 洞察度 6.00

优化 vocab 并行 logprob/entropy 计算,减少内存分配

建议精读 `slime/utils/ppo_utils.py` 中的 in-place 改造和 `sum_softmax_logits` 设计,是典型的 CUDA 显存优化模式。调用侧 `loss.py` 的改动简单,但测试容差变化值得关注。

功能 重要性 7.69 洞察度 5.00

更新 strands_sglang 示例至 0.4.2 API

建议使用 `strands-sglang` 集成或参考该示例的用户仔细阅读代码变更,特别是 `model.rollout` 的用法和内联解释器的实现。该 PR 展示了减少外部依赖、内联关键组件的设计思路。

参与讨论