Prhub

radixark/miles · 标签视图

标签列表

聚合结果

agents 相关 PR

2026-08-18
缺陷修复 重要性 4.35 洞察度 6.00

glm52_tbench2 默认训练集切到 69 任务,修复小型任务集训练发散

值得精读,尤其是 PR body 的诊断叙事:它展示了从 A/B 实验到 per-token dump 取证、再到机制定位的完整调查链,并得出一个有迁移价值的设计决策——当小任务集上同源负 advantage 更新反复自放大时,扩大任务集稀释重复比继续调 knob 更强效。对于从事 RL 训练稳定性、agentic rollout 调优的工程师,这个案例是很好的参考。源码层面改动很小,精读重点是论证逻辑而非代码本身。

缺陷修复 重要性 7.33 洞察度 7.00

修复 GB300 16 节点 tbench2 训练崩溃,折叠三个关键配置杠杆

值得精读。这是「用一次 16 节点 smoke run 的逐 token 取证驱动配置和运行期行为修复」的典型范例:PR body 中关于 `--tis-clip-low` 反向后果、SDK 非幂等重试导致 zombie decode 的量化分析(~1000 引擎侧请求 vs 128 活跃样本)尤其值得关注。建议重点阅读三个设计决策:①TIS clip 下限回归默认值的理由(不要为了"梯度稳定"而违背 importance sampling 语义);②`max_retries=0` 与 `timeout=3600` 的配对逻辑(生成请求不幂等,重试代价高于超时等待);③`finish_reason == "length"` 终结 episode 的边界语义。同时建议跟进 #2591 与 `--max-weight-staleness` 的后续修复,它们与本 PR 构成完整的崩溃治理链路。

缺陷修复 重要性 5.28 洞察度 7.00

权重版本更新不再中止在途请求,修复大规模样本丢弃

值得精读。虽然只有一行改动,但 PR body 提供了完整的根因链与实测数据,能帮助理解 sglang 的 pause、abort、版本 bump 生命周期与 rollout 生产量的关系。建议后续补充针对请求 payload 的回归测试,并关注 sglang 上游参数语义变化。

缺陷修复 重要性 6.51 洞察度 6.00

截断轮次立即结束 episode,消除 22.7% 无效生成时间

值得精读。代码量极小(核心仅 3 行),但问题定位方法极具参考价值:用实测数据(6469 episodes、144.7h/638h、单样本 73% 时间被丢弃)量化不可见浪费,通过 dashboard 渲染盲区反推根因,再以训练端丢弃边界校准 rollout 端生成边界。设计上"截断即停止、但保留评分"的取舍清晰、与训练契约严格对齐,是实现最小修复的范例。

2026-08-15
缺陷修复 重要性 6.34 洞察度 5.00

采集断连不再拖垮整个训练运行

值得精读。这是一个小而精准的生产事故修复:22 行源码与测试联动,但覆盖了大规模训练中最常见的一类稳定性问题。重点学习两点:一是异常边界的刻意收窄 —— 只吸收瞬态传输错误、保留服务器级错误的响亮失败;二是复用已有 ABORTED 机制而非新增降级路径,使修复面最小化。对维护 rollout 基础设施的工程师尤其有参考价值。

2026-08-14

#2536 Carry the rollout id on both agentic paths

原始 PR · 作者 fzyzcjy · 合并时间 2026-08-14 11:47

缺陷修复 重要性 4.88 洞察度 5.00

修复 agentic v1/v2 的 rollout_id 不一致

值得精读,因为这是 session v1/v2 parity 设计与后处理语义交汇处的一次小而关键的修正。建议重点理解两点:一是为什么只对 v2 多叶写 rollout_id,二是它与 #2347 如何在同一个守卫上收敛;这两点对后续 agentic rollout 逻辑有直接影响。

文档 重要性 2.64 洞察度 2.00

环境 bullet 改名 Agentic 并补上 HUD 连接器

无需精读,可作为"功能上线后同步宣传文档"的小型参考。值得注意的设计决策:将链接从连接器列表中移出放到句尾,保持 README 与 docs 首页同步,并让概述页明确覆盖范围。若关注文档与功能一致性治理,可留意 PR#2491 → PR#2533 的演进链。

缺陷修复 重要性 5.84 洞察度 5.00

SWE-agent 示例不再把未上报的 agent 指标记为 0

值得快速精读:核心逻辑只有 7 行改动,但把“缺失”与“真零”的语义区别处理得很干净,测试五场景覆盖完整,适合作为指标上报聚合的最佳实践模板;如果未来把 SWE-agent 示例的指标逻辑提升为通用 agent metrics 模块,本 PR 的缺失值处理方式可直接复用。示例使用者无需额外操作,重新拉取代码即可获得正确指标。