修复 `exec_and_wait` 同 tag 二次调用静默复用旧结果的问题
该 PR 值得精读,尤其是根因分析和修复取舍:`mkdir` guard 的传输级去重与逻辑调用级清理如何解耦。对于依赖 `exec_and_wait` 的 agent 代码,建议检查是否有同 tag 重叠调用的隐患,并确认第三方 sandbox 实现已接受 `idempotent` 参数。测试中的 `ShellFakeSandbox` 设计(解释 shell 字符串而非逐命令 mock)也值得借鉴。
标签列表
聚合结果
修复 `exec_and_wait` 同 tag 二次调用静默复用旧结果的问题
该 PR 值得精读,尤其是根因分析和修复取舍:`mkdir` guard 的传输级去重与逻辑调用级清理如何解耦。对于依赖 `exec_and_wait` 的 agent 代码,建议检查是否有同 tag 重叠调用的隐患,并确认第三方 sandbox 实现已接受 `idempotent` 参数。测试中的 `ShellFakeSandbox` 设计(解释 shell 字符串而非逐命令 mock)也值得借鉴。
原始 PR · 作者 jingshenghang · 合并时间 2026-07-02 11:05
SWE 评分协议可配置 + Sandbox RPC 稳健性增强
值得精读,尤其是 `exec_and_wait` 的设计模式和 `E2BSandbox._rpc_retry` 的幂等性策略;评分协议的策略模式也很清晰。建议关注截断逻辑的正确性和重试异常覆盖。
原始 PR · 作者 jingshenghang · 合并时间 2026-06-23 14:57
新增 SWE_AGENT 环境变量支持选择 agent 实现
值得精读。该 PR 展示了一种简单而优雅的 agent 选择模式(注册表 + 环境变量注入),符合开闭原则,便于后续扩展。对于其他需要多后端/多实现的场景有借鉴意义。
原始 PR · 作者 jingshenghang · 合并时间 2026-06-23 14:57
修复 SWE coding-agent RL 稳定性问题
建议精读。PR 展示了 agent RL 训练中异常处理的最佳实践:通过 `drop_session` 分离清理与样本生成,通过 `rollout_log_probs=[0.0]` 和 `remove_sample=True` 优雅处理中止样本。测试覆盖不足,后续可补充。
README 新增 Dressage 框架介绍
该 PR 为简单的文档更新,无需深入审查。建议合并,以完善生态系统文档。
原始 PR · 作者 jingshenghang · 合并时间 2026-06-17 10:08
用消息树 TrajectoryManager 替换分段轨迹,新增可插拔 harness 层
强烈建议精读:设计中消息树模型和 token drift 处理是核心创新点;review 中的性能讨论(chunk 比较、dict 比较)和设计权衡(fork vs replace)有很高的学习价值。对于需要扩展新的 LLM agent 或改进多轮 RL 训练的项目,此 PR 提供了可复用的模式。
修复 search-r1 生成中停止标签缺失问题
该 PR 值得合并,修复逻辑清晰且风险低。建议确认 `no_stop_trim=True` 的行为与预期一致,并可考虑为类似示例提供通用停止标签配置模式。
原始 PR · 作者 Jiang020609 · 合并时间 2026-06-01 16:49
保留多智能体 rollout logprobs
可直接合并。修复了 issue 中报告的问题,代码简洁且与主框架的 rollout 实现一致。