Prhub

radixark/miles · 标签视图

标签列表

聚合结果

models 相关 PR

2026-09-01
功能 重要性 9.36 洞察度 6.00

DSv4 双后端可选,对齐 Megatron 权重契约,恢复训练

值得精读。该 PR 展示了三类可借鉴的设计决策:一是用显式 raise 替代静默 fallback,杜绝用户不知情的实现漂移;二是通过统一 checkpoint 命名契约让两种实现共享同一数据源,并用 `assert_checkpoint_is_current` 做防御性拒绝;三是利用已有的原子更新组把分散参数在导出时重新聚合(`_packed_alphas` 的 bucket 传递),是分布式 checkpoint 转换中优雅的处理方式。PR body 中关于 tid2eid、SwiGLU clamp、MTP replay 等调试细节也极具参考价值。

#2791 test(tito): use FP8 Qwen3.6 checkpoint

原始 PR · 作者 guapisolo · 合并时间 2026-09-01 04:13

测试 重要性 3.46 洞察度 2.00

Qwen3.6 会话测试改用 FP8 检查点,验证目标不变

该 PR 不值得精读,可快速合并。值得注意的设计原则是“验证目标优先于 artifact 选择”——在 CI 面上用更轻量的检查点保持等价覆盖,而非削弱验证范围。若想理解 TITO Qwen3.6 支持的全貌,建议阅读上游 PR #2759(引入 tito_tokenizer、qwen3.6_fixed.jinja 模板与 test_qwen36.py)。

功能 重要性 6.93 洞察度 5.00

Qwen3.8 系列新增双 TITO 家族名共享固定渲染模板

值得精读,重点看三处设计决策:(1) 两个公共枚举映射到同一个 tokenizer 类的工厂写法,如何避免复制 renderer;(2) 固定默认 reasoning 模式并显式拒绝冲突 kwargs 的保护机制,防止缓存前缀静默失配;(3) FIXME 驱动的临时行为显式化,为后续 request-argument 优先级重构留出清晰的演进路径。若团队要新增类似“共享序列化契约、不同公共名”的模型家族,可直接复用本 PR 的模式。

2026-08-28

#2788 docs: add the GLM-5.3-Flash RL recipe page

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-28 03:44

文档 重要性 3.65 洞察度 3.00

新增 GLM-5.3-Flash RL 配方文档页并接入导航

常规文档 PR,无需精读代码,但建议:1) 用 2 分钟浏览页面结构与 #2786 的对应关系,确认命令和镜像版本;2) 在 #2786 合并时做一次同步复核,避免文档与实现漂移。值得借鉴的是「文档先行 + 版本固定 + 验证范围声明」的写法,适合作为后续新模型配方文档的模板。

文档 重要性 4.29 洞察度 4.00

新增 Qwen3.8-Flash-Next RL 配方文档页并接入导航

若在做 Qwen3.8-Flash-Next 或类似 GDN/QSA 模型的接入,值得精读该页面中“三大超纲组件”段落,尤其是 `hc_head_contraction` 与 PLE 权重更新跳过列表;其余读者快速扫过即可。值得关注的设计决策:作者将复杂技术权衡写进 recipe 而非 PR 讨论,方便后续维护者追溯实现动机。

2026-08-27
测试 重要性 3.59 洞察度 3.00

测试适配 sglang 新异常类型

此 PR 值得快速浏览,但无需精读。它展示了处理依赖库升级导致的测试兼容性问题的最佳实践:通过匹配错误消息而非异常类型,使测试对依赖版本变化更具鲁棒性。

功能 重要性 6.89 洞察度 6.00

TITO 新增 Qwen3.6 模板,拆分 Qwen3.5/3.6 序列化合约

值得精读。核心看点在于"按家族拆分模板而非共享模板"的设计决策:当两个模型家族的渲染合约存在细微序列化差异时,共享模板会静默改变旧家族行为,拆分并配以参数化测试锁定差异是稳健做法。建议关注 `tito_tokenizer.py` 中 `FIXED_TEMPLATE` 注册模式、`preserve_thinking` 与 `clear_thinking` 的语义区别,以及 e2e 测试如何用 `tito_session_mismatch_rate` 指标做 CI gate。合并时注意 reviewer 提到的与 PR 2711 的兼容性提醒。

2026-08-26

#2741 Add Terminus 2 compaction training example

原始 PR · 作者 Shi-Dong · 合并时间 2026-08-26 03:44

功能 重要性 8.01 洞察度 5.00

新增 Terminus 2 compaction 训练示例

值得精读,尤其是 `run.py` 中 `_build_train_args` 对 session server v2 与 TITO、GRPO 的串接方式,以及 README 中对 compaction 心理模型的解释。对需要设计训练配方或复现 RL 实验结果的同学,这是一份很好的参考模板;对核心代码维护者,仅需关注新增测试是否与 `py_harness` 的兼容性。