2026-09-01
空 step 补全声明式 schema,修复 dashboard 多页面 500 崩溃
值得精读。改动量不大但信息密度高:polars 空数据 schema 推断陷阱、缓存版本在格式迁移中的作用(mtime 匹配 ≠ 格式有效)、并发读下的原子写、以及「先用 revert 实验证明测试能抓到 bug 再提交」的验证方法(PR body 中 2 failed 的对照表)。对 dashboard 维护者、做数据管道容错的工程师尤其有参考价值;`blank_samples` 夹具和 `test_pre_fix_columnless_cache_is_not_served` 是两段值得模仿的测试写法。
DSv4 双后端可选,对齐 Megatron 权重契约,恢复训练
值得精读。该 PR 展示了三类可借鉴的设计决策:一是用显式 raise 替代静默 fallback,杜绝用户不知情的实现漂移;二是通过统一 checkpoint 命名契约让两种实现共享同一数据源,并用 `assert_checkpoint_is_current` 做防御性拒绝;三是利用已有的原子更新组把分散参数在导出时重新聚合(`_packed_alphas` 的 bucket 传递),是分布式 checkpoint 转换中优雅的处理方式。PR body 中关于 tid2eid、SwiGLU clamp、MTP replay 等调试细节也极具参考价值。
Qwen3.6 会话测试改用 FP8 检查点,验证目标不变
该 PR 不值得精读,可快速合并。值得注意的设计原则是“验证目标优先于 artifact 选择”——在 CI 面上用更轻量的检查点保持等价覆盖,而非削弱验证范围。若想理解 TITO Qwen3.6 支持的全貌,建议阅读上游 PR #2759(引入 tito_tokenizer、qwen3.6_fixed.jinja 模板与 test_qwen36.py)。
Qwen3.8 系列新增双 TITO 家族名共享固定渲染模板
值得精读,重点看三处设计决策:(1) 两个公共枚举映射到同一个 tokenizer 类的工厂写法,如何避免复制 renderer;(2) 固定默认 reasoning 模式并显式拒绝冲突 kwargs 的保护机制,防止缓存前缀静默失配;(3) FIXME 驱动的临时行为显式化,为后续 request-argument 优先级重构留出清晰的演进路径。若团队要新增类似“共享序列化契约、不同公共名”的模型家族,可直接复用本 PR 的模式。