修复 `exec_and_wait` 同 tag 二次调用静默复用旧结果的问题
该 PR 值得精读,尤其是根因分析和修复取舍:`mkdir` guard 的传输级去重与逻辑调用级清理如何解耦。对于依赖 `exec_and_wait` 的 agent 代码,建议检查是否有同 tag 重叠调用的隐患,并确认第三方 sandbox 实现已接受 `idempotent` 参数。测试中的 `ShellFakeSandbox` 设计(解释 shell 字符串而非逐命令 mock)也值得借鉴。
slime is an LLM post-training framework for RL Scaling.
修复 `exec_and_wait` 同 tag 二次调用静默复用旧结果的问题
该 PR 值得精读,尤其是根因分析和修复取舍:`mkdir` guard 的传输级去重与逻辑调用级清理如何解耦。对于依赖 `exec_and_wait` 的 agent 代码,建议检查是否有同 tag 重叠调用的隐患,并确认第三方 sandbox 实现已接受 `idempotent` 参数。测试中的 `ShellFakeSandbox` 设计(解释 shell 字符串而非逐命令 mock)也值得借鉴。
修复 load_other_checkpoint 未还原 args.ckpt_step 导致后续加载错迭代
建议合入此修复,因为它修复了一个静默的错误权重加载问题,且改动简单、逻辑清晰。值得关注的设计是使用 `old_args` 元组统一保存和还原多个参数,这是该模式的一次合理扩展,也提示团队在未来修改 `load_other_checkpoint` 时注意参数生命周期的管理。
原始 PR · 作者 coding-famer · 合并时间 2026-08-12 13:44
修复外部引擎 debug_rollout_only 下 placement group 崩溃
该 PR 属于针对特定调试模式的 bugfix,建议合入。虽然代码变更简单,但涉及 placement group 布局,可能影响训练资源分配,值得快速审查。可关注后续是否有类似组合的其他布局问题。
修复多head MTP训练日志崩溃
该PR值得精读,因为它修复了多head MTP训练的关键bug。设计决策上,采用保留向量并分别记录每个head loss的方式,为后续分析提供了更细粒度的信息。建议补充单元测试覆盖多head MTP场景,防止回归。
原始 PR · 作者 coding-famer · 合并时间 2026-08-12 13:41
澄清 PPO/Critic 文档:共享 GPU 与 --megatron-config-path
值得快速浏览,重点是 PPO 资源分配的新说明和 --megatron-config-path 的角色覆盖方式;纯文档变更,无需精读,但可作为配置 PPO 时的参考手册。
在 examples/README 中补充 coding_agent_rl 条目
该 PR 为普通文档维护,无技术深度,但体现了对示例可发现性的重视。可快速浏览,无需精读。
原始 PR · 作者 zhangdw156 · 合并时间 2026-08-12 13:38
在中文 README 生态区新增 Dressage 条目,与英文版对齐。
此 PR 价值有限,不值得精读。它只是简单的文档同步,但体现了维护者保持文档一致性的努力。
向量化 REINFORCE++ 折扣回报计算并复用 GAE 扫描
值得精读。该 PR 展示了如何把 O(T) 串行递归安全地替换为分块并行扫描,并通过“提取通用 helper + 参考实现对照测试”控制重构风险。重点关注 `chunked_discounted_returns` 的 chunk 内扫描与跨 chunk 状态传播设计、右 padding/trim 的数值正确性论证,以及 `chunked_gae` 复用后行为是否保持。合并评审时建议补充一个真实的 context-parallel 集成测试或 GPU 冒烟测试。
参与讨论