Prhub

THUDM/slime · 标签视图

标签列表

聚合结果

agentic 相关 PR

2026-08-12
缺陷修复 重要性 7.13 洞察度 5.00

修复 `exec_and_wait` 同 tag 二次调用静默复用旧结果的问题

该 PR 值得精读,尤其是根因分析和修复取舍:`mkdir` guard 的传输级去重与逻辑调用级清理如何解耦。对于依赖 `exec_and_wait` 的 agent 代码,建议检查是否有同 tag 重叠调用的隐患,并确认第三方 sandbox 实现已接受 `idempotent` 参数。测试中的 `ShellFakeSandbox` 设计(解释 shell 字符串而非逐命令 mock)也值得借鉴。

2026-07-02
功能 重要性 9.18 洞察度 7.00

SWE 评分协议可配置 + Sandbox RPC 稳健性增强

值得精读,尤其是 `exec_and_wait` 的设计模式和 `E2BSandbox._rpc_retry` 的幂等性策略;评分协议的策略模式也很清晰。建议关注截断逻辑的正确性和重试异常覆盖。

2026-06-23
功能 重要性 5.29 洞察度 5.00

新增 SWE_AGENT 环境变量支持选择 agent 实现

值得精读。该 PR 展示了一种简单而优雅的 agent 选择模式(注册表 + 环境变量注入),符合开闭原则,便于后续扩展。对于其他需要多后端/多实现的场景有借鉴意义。

缺陷修复 重要性 6.27 洞察度 6.00

修复 SWE coding-agent RL 稳定性问题

建议精读。PR 展示了 agent RL 训练中异常处理的最佳实践:通过 `drop_session` 分离清理与样本生成,通过 `rollout_log_probs=[0.0]` 和 `remove_sample=True` 优雅处理中止样本。测试覆盖不足,后续可补充。

2026-06-21
2026-06-17
重构 重要性 9.18 洞察度 7.00

用消息树 TrajectoryManager 替换分段轨迹,新增可插拔 harness 层

强烈建议精读:设计中消息树模型和 token drift 处理是核心创新点;review 中的性能讨论(chunk 比较、dict 比较)和设计权衡(fork vs replace)有很高的学习价值。对于需要扩展新的 LLM agent 或改进多轮 RL 训练的项目,此 PR 提供了可复用的模式。

2026-06-13
缺陷修复 重要性 5.55 洞察度 3.00

修复 search-r1 生成中停止标签缺失问题

该 PR 值得合并,修复逻辑清晰且风险低。建议确认 `no_stop_trim=True` 的行为与预期一致,并可考虑为类似示例提供通用停止标签配置模式。

2026-06-01