#2602 glm52_tbench2: default the train set to the 69-task split
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 18:07
glm52_tbench2 默认训练集切到 69 任务,修复小型任务集训练发散
值得精读,尤其是 PR body 的诊断叙事:它展示了从 A/B 实验到 per-token dump 取证、再到机制定位的完整调查链,并得出一个有迁移价值的设计决策——当小任务集上同源负 advantage 更新反复自放大时,扩大任务集稀释重复比继续调 knob 更强效。对于从事 RL 训练稳定性、agentic rollout 调优的工程师,这个案例是很好的参考。源码层面改动很小,精读重点是论证逻辑而非代码本身。