新增 Terminus 2 compaction 训练示例
值得精读,尤其是 `run.py` 中 `_build_train_args` 对 session server v2 与 TITO、GRPO 的串接方式,以及 README 中对 compaction 心理模型的解释。对需要设计训练配方或复现 RL 实验结果的同学,这是一份很好的参考模板;对核心代码维护者,仅需关注新增测试是否与 `py_harness` 的兼容性。
标签列表
聚合结果
新增 Terminus 2 compaction 训练示例
值得精读,尤其是 `run.py` 中 `_build_train_args` 对 session server v2 与 TITO、GRPO 的串接方式,以及 README 中对 compaction 心理模型的解释。对需要设计训练配方或复现 RL 实验结果的同学,这是一份很好的参考模板;对核心代码维护者,仅需关注新增测试是否与 `py_harness` 的兼容性。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 18:07
glm52_tbench2 默认训练集切到 69 任务,修复小型任务集训练发散
值得精读,尤其是 PR body 的诊断叙事:它展示了从 A/B 实验到 per-token dump 取证、再到机制定位的完整调查链,并得出一个有迁移价值的设计决策——当小任务集上同源负 advantage 更新反复自放大时,扩大任务集稀释重复比继续调 knob 更强效。对于从事 RL 训练稳定性、agentic rollout 调优的工程师,这个案例是很好的参考。源码层面改动很小,精读重点是论证逻辑而非代码本身。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-12 07:15
Daytona 配方改用 --fully-async 以启用参数互斥校验
值得快速浏览,特别是对全异步 rollout 参数互斥设计感兴趣的读者,可对照 miles/utils/arguments.py 中 _resolve_rollout_functions 理解校验意图。长期建议为该配方补充一条启动脚本快照测试或文档说明,避免再次出现绕过校验的写法。
新增 E2B/AgentENV 沙箱后端,重构沙箱编排共享层
值得精读。重点看三个设计:一是 `template_alias` 的 recipe-digest 别名机制,把“何时重新构建镜像”从人工约定变成确定性哈希;二是 `openenv_sandbox_common.create_once` 对 `asyncio.to_thread` 不可取消性的处理,用守护线程 reaper 回收孤儿沙箱,避免资源泄漏与计费;三是启动器层“只转发密钥文件路径、不转发密钥值”的安全契约,对 Ray runtime_env 明文日志问题给出低成本解法。若要扩展新的沙箱 provider,本 PR 的注册表与共享层是很好的模板。
删除无人消费的 daytona bake 快照 CLI
建议快速浏览而非精读:变更单文件且为纯删除,无新逻辑。值得借鉴的是 PR body 的“可消费性论证”——从 API 参数类型不匹配(CreateSandboxFromImageParams 与 CreateSandboxFromSnapshotParams)、资源配额约束(org 500 上限)、全局 grep 检索三层证明死代码无可消费方,这种删除理由的严谨性可复用于同类清理。合并后应复核 #1913 的 rebase 约定是否落地,并在 openenv 目录内搜索残留的 bake 或 snapshot_name 引用。
共享服务器腿改原生打分,退役适配补偿
值得精读,尤其适合想理解「删除兼容分支时如何保正确性」的工程师。三个看点:(1) 运行时契约守卫的设计——当 preflight 不可行时,用回复自身的契约指纹(info.harness)把静默误打分变成大声失败;(2) 跨仓库边界的演进编排——miles 侧 PR 明确依赖上游 OpenEnv#1012 且给出双向不兼容的切换顺序;(3) review 中 Shi-Dong 抓出的 0.0 vs None 差异,是「删除看似等价代码」时最容易漏掉的行为边界。