新增 forge_load 重放 rollout dump 且保持 sglang 运行
建议负责内存测试和 rollout 框架的团队成员精读此 PR,了解 forge_load 的设计细节及如何用于内存测试。值得关注的设计决策:eval 没有 fallback 以防止静默数据错配;不修改 sample.rollout_id 以保持分组正确;与 --load-debug-rollout-data 的战略分工。
slime is an LLM post-training framework for RL Scaling.
新增 forge_load 重放 rollout dump 且保持 sglang 运行
建议负责内存测试和 rollout 框架的团队成员精读此 PR,了解 forge_load 的设计细节及如何用于内存测试。值得关注的设计决策:eval 没有 fallback 以防止静默数据错配;不修改 sample.rollout_id 以保持分组正确;与 --load-debug-rollout-data 的战略分工。
新增 Agent RL 文档与路线图
值得精读。尤其是 customization.md 中关于 custom_generate 返回多个样本的契约(共享 rollout_id)和奖励分配模式,是设计 agent 训练的重要决策。
抽取 coding_agent_rl 通用工具到核心 agent 模块
建议代码审查者重点关注 trajectory.py 中 merge_turns 的多轮对齐逻辑和 parsing.py 的工具调用解析路径,确保与原有行为一致。值得阅读的设计决策包括将配置从环境变量迁移到 args 的统一管理方式。
原始 PR · 作者 jingshenghang · 合并时间 2026-05-27 13:52
修复 flush_cache 非 200 响应时缺少日志和退避问题
值得快速合并,属于防御性改进。修复了静默错误和无效重试,提升系统可观测性和稳定性。
原始 PR · 作者 lilei199908 · 合并时间 2026-05-27 12:32
禁用参数CPU备份以节省主机内存
该PR值得性能优化工程师和训练系统开发者关注,尤其是如何通过禁用不必要的CPU备份来节省内存的设计决策,以及对Megatron底层补丁的实现技巧。
将 coding_agent_rl 辅助函数从 generate.py 移至 sandbox.py
该 PR 是常规精简重构,值得学习其模块拆分思路。如果正在使用 coding_agent_rl 示例,建议同步更新代码以避免引用过时的私有函数。
重构 agent RL 生成逻辑并移除 SWE_LIST_TRAJECTORY 配置
值得精读 generate.py 的模块化拆分方式,以及如何将单体生成函数重构为管道式编排。同时注意配置移除可能对现有实验脚本的影响,建议运行 fan-out 测试验证。
将 sandbox 从示例迁移至核心 slime/agent 模块,定义协议接口
值得精读,尤其关注 `Sandbox` 协议的设计方式(Protocol + runtime_checkable)、环境变量优先级的处理策略以及 RPC 重试的指数退避实现。这些设计模式可复用于其他需要后端抽象的模块。
参与讨论