README 与文档首页补充 Diffusion 后训练指引,指向独立仓库
不值得精读代码——本 PR 无代码改动,实现上只有一条 bullet 的两处复制。值得关注的点在于:它暴露了 miles 生态正在向多仓库演进(diffusion 能力线独立成仓库),以及 README 与 docs/index.md 双副本同步这一组织性维护成本。建议浏览 1 分钟即可,重点留意后续是否会出现更多类似"指向子仓库"的文档条目。
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
README 与文档首页补充 Diffusion 后训练指引,指向独立仓库
不值得精读代码——本 PR 无代码改动,实现上只有一条 bullet 的两处复制。值得关注的点在于:它暴露了 miles 生态正在向多仓库演进(diffusion 能力线独立成仓库),以及 README 与 docs/index.md 双副本同步这一组织性维护成本。建议浏览 1 分钟即可,重点留意后续是否会出现更多类似"指向子仓库"的文档条目。
主站新增 Diffusion 文档分区,同步 miles_diffusion 全套指南
值得快速浏览而非精读:这是一次高质量的文档体系扩展,单页内容密度高。建议重点阅读 customization.md(了解 miles-diffusion 的 --*-path 扩展架构,对要定制 diffusion 训练的用户是必读入口)和 launch-script.md(理解批量大小算术与各 flag 分组)。对文档维护者而言,commit c346dee 揭示的 docs.json 格式所有权冲突是本次最值得记住的工程细节——编辑该文件前先确认 sync-example-docs hook 的约定。
文档表格将裸 Qwen3.8 改为 Qwen3.8-27B 并补齐首页入口
不值得精读。本 PR 是一个低优先级的文档修正,无需深入 review 代码;值得关注的是其体现的文档严谨性约束——模型表格的命名必须准确反映变体的可运行性状态。后续维护者应在 #2488 合并时同步更新这两个表格。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 08:36
修复 CP/PP 分片下 dashboard 视图错位与 --follow 双计数
值得精读。设计上把 split/assemble 收敛到同一个偏移函数并用 round-trip 测试固定,是保持并行语义一致的典范。旧 dump 的布局恢复通过“内容分组 + 宽度校验”避免了破坏性迁移,值得借鉴。并发 race 修复方式简单直接(锁住整个读-解析-追加事务),适合作为类似场景的参考。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 08:36
修复 GB300 16 节点 tbench2 训练崩溃,折叠三个关键配置杠杆
值得精读。这是「用一次 16 节点 smoke run 的逐 token 取证驱动配置和运行期行为修复」的典型范例:PR body 中关于 `--tis-clip-low` 反向后果、SDK 非幂等重试导致 zombie decode 的量化分析(~1000 引擎侧请求 vs 128 活跃样本)尤其值得关注。建议重点阅读三个设计决策:①TIS clip 下限回归默认值的理由(不要为了"梯度稳定"而违背 importance sampling 语义);②`max_retries=0` 与 `timeout=3600` 的配对逻辑(生成请求不幂等,重试代价高于超时等待);③`finish_reason == "length"` 终结 episode 的边界语义。同时建议跟进 #2591 与 `--max-weight-staleness` 的后续修复,它们与本 PR 构成完整的崩溃治理链路。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 08:07
权重版本更新不再中止在途请求,修复大规模样本丢弃
值得精读。虽然只有一行改动,但 PR body 提供了完整的根因链与实测数据,能帮助理解 sglang 的 pause、abort、版本 bump 生命周期与 rollout 生产量的关系。建议后续补充针对请求 payload 的回归测试,并关注 sglang 上游参数语义变化。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 08:07
截断轮次立即结束 episode,消除 22.7% 无效生成时间
值得精读。代码量极小(核心仅 3 行),但问题定位方法极具参考价值:用实测数据(6469 episodes、144.7h/638h、单样本 73% 时间被丢弃)量化不可见浪费,通过 dashboard 渲染盲区反推根因,再以训练端丢弃边界校准 rollout 端生成边界。设计上"截断即停止、但保留评分"的取舍清晰、与训练契约严格对齐,是实现最小修复的范例。
原始 PR · 作者 yueming-yuan · 合并时间 2026-08-18 07:18
补齐 H200/B200/B300 的每节点 GPU 数映射
值得快速合并(已合并)。这个修复解除了真实的启动阻断,但属于防御性薄弱的小改动。建议后续为 `NUM_GPUS_OF_HARDWARE` 补充单元测试,或与 `GENERATION_HARDWARE` 合并维护,避免同源字段不同步。
参与讨论