2026-09-01
gpu 模式重排交接顺序,缓解 GB300 主机内存峰值
值得精读。核心看点是 `train.py` 中 handoff 重排的先后顺序论证,以及 `rollout_manager` 细粒度 offload API 如何与 `offload_rollout_level` 配合达到语义自洽。由于没有单测,建议结合 #2706 的 e2e 验证上下文阅读,并关注后续是否补强测试,尤其是 `cpu` 模式下 `onload_weights` 新增 guard 的兼容性测试。
Rollouts 标签落在首个可读 step,修复实时点击报错
值得精读。改动虽小但完整呈现了一个前端修复的工程方法论:先枚举全部失败形态再决定统一处理策略(threw 与 empty 同等对待)、为回退探测设置语义边界(5 步后停止并暴露真实错误)、处理异步间隙的竞态守卫、考虑历史栈与重试预算。“有界回看 + 显式请求不重定向”的组合对同类 dashboard 导航很有借鉴意义。若后续要为 dashboard 前端补测试设施,本 PR 的 Playwright 验证矩阵(3 种 dump × 4 种检查)是现成的回归用例清单。
Qwen3.6 会话测试改用 FP8 检查点,验证目标不变
该 PR 不值得精读,可快速合并。值得注意的设计原则是“验证目标优先于 artifact 选择”——在 CI 面上用更轻量的检查点保持等价覆盖,而非削弱验证范围。若想理解 TITO Qwen3.6 支持的全貌,建议阅读上游 PR #2759(引入 tito_tokenizer、qwen3.6_fixed.jinja 模板与 test_qwen36.py)。
disk-delta 基线校验张量 dtype/形状,拒绝非规范布局
值得精读。核心设计是“规范化校验前置 + 集合通信错误同步”:在分布式训练中,source rank 的校验错误不能立即抛出(会中断 collectives),通过 `all_gather_object` 聚合后再统一失败,是一个可复用的模式。dtype 映射表的做法(safetensors 不暴露 torch dtype 编码器)也值得注意。建议关注点:移除 fallback 后的兼容性边界、未来新 dtype 的扩展点、以及错误聚合的通信开销。