按 AdapterRef 隔离奖励聚合键,修复 Multi-LoRA 指标偏差
该 PR 是一个小而精准的修复,值得精读,特别是理解 `AdapterRef` 在 Multi-LoRA 中的关键作用。测试覆盖了核心场景,推动了指标正确性。
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
按 AdapterRef 隔离奖励聚合键,修复 Multi-LoRA 指标偏差
该 PR 是一个小而精准的修复,值得精读,特别是理解 `AdapterRef` 在 Multi-LoRA 中的关键作用。测试覆盖了核心场景,推动了指标正确性。
原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-28 03:44
新增 GLM-5.3-Flash RL 配方文档页并接入导航
常规文档 PR,无需精读代码,但建议:1) 用 2 分钟浏览页面结构与 #2786 的对应关系,确认命令和镜像版本;2) 在 #2786 合并时做一次同步复核,避免文档与实现漂移。值得借鉴的是「文档先行 + 版本固定 + 验证范围声明」的写法,适合作为后续新模型配方文档的模板。
原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-28 00:55
新增 Qwen3.8-Flash-Next RL 配方文档页并接入导航
若在做 Qwen3.8-Flash-Next 或类似 GDN/QSA 模型的接入,值得精读该页面中“三大超纲组件”段落,尤其是 `hc_head_contraction` 与 PLE 权重更新跳过列表;其余读者快速扫过即可。值得关注的设计决策:作者将复杂技术权衡写进 recipe 而非 PR 讨论,方便后续维护者追溯实现动机。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-27 16:08
sglang 升级 v0.5.18 并适配 torch 2.13
值得精读。重点有三个:一是 PR body 本身就是依赖升级工程的范本——回滚点定义、中转基线选择(736 vs 1317 drift)、冲突取舍原则(上游新形态为准、行为重表达)都写得很清楚;二是 `_forward_remaining_collectives()` 的自动转发设计,用元编程根除手工维护清单的复发式 bug,值得在同类 wrapper 场景复用;三是 det PG 覆盖范围先放大再收敛的过程,展示了如何靠多 GPU 测试逐步逼近最小必要改动。若团队后续还要升级 sglang/torch,建议直接对照此 PR 的适配清单。
原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-27 14:53
测试适配 sglang 新异常类型
此 PR 值得快速浏览,但无需精读。它展示了处理依赖库升级导致的测试兼容性问题的最佳实践:通过匹配错误消息而非异常类型,使测试对依赖版本变化更具鲁棒性。
TITO 新增 Qwen3.6 模板,拆分 Qwen3.5/3.6 序列化合约
值得精读。核心看点在于"按家族拆分模板而非共享模板"的设计决策:当两个模型家族的渲染合约存在细微序列化差异时,共享模板会静默改变旧家族行为,拆分并配以参数化测试锁定差异是稳健做法。建议关注 `tito_tokenizer.py` 中 `FIXED_TEMPLATE` 注册模式、`preserve_thinking` 与 `clear_thinking` 的语义区别,以及 e2e 测试如何用 `tito_session_mismatch_rate` 指标做 CI gate。合并时注意 reviewer 提到的与 PR 2711 的兼容性提醒。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-27 08:51
修复 /rerun-test 默认镜像逻辑
建议精读该 PR,它展示了 CI 镜像选择逻辑的优化思路,对维护 CI 流程有一定参考价值。值得关注的是如何通过检查镜像是否存在来优雅回退,以及如何通过认证避免限流问题。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-26 10:39
豁免 .claude 技能测试,修复 CI 全红
该 PR 是必要的 CI 修复,建议合并;其设计决策(将 .claude/ 与 tests/ 同等豁免)值得在类似场景中借鉴。
参与讨论