Prhub

THUDM/slime

slime is an LLM post-training framework for RL Scaling.

监控状态:已开启 最近同步:2026-09-01 15:21 同步状态:空闲 下次计划:2026-09-01 16:21

PR 列表

更多筛选
2026-08-12
缺陷修复 重要性 7.13 洞察度 5.00

修复 `exec_and_wait` 同 tag 二次调用静默复用旧结果的问题

该 PR 值得精读,尤其是根因分析和修复取舍:`mkdir` guard 的传输级去重与逻辑调用级清理如何解耦。对于依赖 `exec_and_wait` 的 agent 代码,建议检查是否有同 tag 重叠调用的隐患,并确认第三方 sandbox 实现已接受 `idempotent` 参数。测试中的 `ShellFakeSandbox` 设计(解释 shell 字符串而非逐命令 mock)也值得借鉴。

缺陷修复 重要性 6.18 洞察度 5.00

修复 load_other_checkpoint 未还原 args.ckpt_step 导致后续加载错迭代

建议合入此修复,因为它修复了一个静默的错误权重加载问题,且改动简单、逻辑清晰。值得关注的设计是使用 `old_args` 元组统一保存和还原多个参数,这是该模式的一次合理扩展,也提示团队在未来修改 `load_other_checkpoint` 时注意参数生命周期的管理。

缺陷修复 重要性 4.97 洞察度 3.00

修复外部引擎 debug_rollout_only 下 placement group 崩溃

该 PR 属于针对特定调试模式的 bugfix,建议合入。虽然代码变更简单,但涉及 placement group 布局,可能影响训练资源分配,值得快速审查。可关注后续是否有类似组合的其他布局问题。

缺陷修复 重要性 5.73 洞察度 3.00

修复多head MTP训练日志崩溃

该PR值得精读,因为它修复了多head MTP训练的关键bug。设计决策上,采用保留向量并分别记录每个head loss的方式,为后续分析提供了更细粒度的信息。建议补充单元测试覆盖多head MTP场景,防止回归。

#2189 [Doc] Clarify PPO/Critic docs after #1856

原始 PR · 作者 coding-famer · 合并时间 2026-08-12 13:41

文档 重要性 2.97 洞察度 2.00

澄清 PPO/Critic 文档:共享 GPU 与 --megatron-config-path

值得快速浏览,重点是 PPO 资源分配的新说明和 --megatron-config-path 的角色覆盖方式;纯文档变更,无需精读,但可作为配置 PPO 时的参考手册。

文档 重要性 1.89 洞察度 2.00

在中文 README 生态区新增 Dressage 条目,与英文版对齐。

此 PR 价值有限,不值得精读。它只是简单的文档同步,但体现了维护者保持文档一致性的努力。

#2205 perf: vectorize REINFORCE++ discounted returns

原始 PR · 作者 morluto · 合并时间 2026-08-12 13:36

性能优化 重要性 7.73 洞察度 6.00

向量化 REINFORCE++ 折扣回报计算并复用 GAE 扫描

值得精读。该 PR 展示了如何把 O(T) 串行递归安全地替换为分块并行扫描,并通过“提取通用 helper + 参考实现对照测试”控制重构风险。重点关注 `chunked_discounted_returns` 的 chunk 内扫描与跨 chunk 状态传播设计、右 padding/trim 的数值正确性论证,以及 `chunked_gae` 复用后行为是否保持。合并评审时建议补充一个真实的 context-parallel 集成测试或 GPU 冒烟测试。

参与讨论