Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 16:32 同步状态:空闲 下次计划:2026-09-01 17:32

PR 列表

更多筛选 · 已设定
✕ 清空
2026-09-01
性能优化 重要性 6.89 洞察度 5.00

gpu 模式重排交接顺序,缓解 GB300 主机内存峰值

值得精读。核心看点是 `train.py` 中 handoff 重排的先后顺序论证,以及 `rollout_manager` 细粒度 offload API 如何与 `offload_rollout_level` 配合达到语义自洽。由于没有单测,建议结合 #2706 的 e2e 验证上下文阅读,并关注后续是否补强测试,尤其是 `cpu` 模式下 `onload_weights` 新增 guard 的兼容性测试。

缺陷修复 重要性 7.19 洞察度 7.00

空 step 补全声明式 schema,修复 dashboard 多页面 500 崩溃

值得精读。改动量不大但信息密度高:polars 空数据 schema 推断陷阱、缓存版本在格式迁移中的作用(mtime 匹配 ≠ 格式有效)、并发读下的原子写、以及「先用 revert 实验证明测试能抓到 bug 再提交」的验证方法(PR body 中 2 failed 的对照表)。对 dashboard 维护者、做数据管道容错的工程师尤其有参考价值;`blank_samples` 夹具和 `test_pre_fix_columnless_cache_is_not_served` 是两段值得模仿的测试写法。

缺陷修复 重要性 6.88 洞察度 6.00

Rollouts 标签落在首个可读 step,修复实时点击报错

值得精读。改动虽小但完整呈现了一个前端修复的工程方法论:先枚举全部失败形态再决定统一处理策略(threw 与 empty 同等对待)、为回退探测设置语义边界(5 步后停止并暴露真实错误)、处理异步间隙的竞态守卫、考虑历史栈与重试预算。“有界回看 + 显式请求不重定向”的组合对同类 dashboard 导航很有借鉴意义。若后续要为 dashboard 前端补测试设施,本 PR 的 Playwright 验证矩阵(3 种 dump × 4 种检查)是现成的回归用例清单。

功能 重要性 9.36 洞察度 6.00

DSv4 双后端可选,对齐 Megatron 权重契约,恢复训练

值得精读。该 PR 展示了三类可借鉴的设计决策:一是用显式 raise 替代静默 fallback,杜绝用户不知情的实现漂移;二是通过统一 checkpoint 命名契约让两种实现共享同一数据源,并用 `assert_checkpoint_is_current` 做防御性拒绝;三是利用已有的原子更新组把分散参数在导出时重新聚合(`_packed_alphas` 的 bucket 传递),是分布式 checkpoint 转换中优雅的处理方式。PR body 中关于 tid2eid、SwiGLU clamp、MTP replay 等调试细节也极具参考价值。

#2791 test(tito): use FP8 Qwen3.6 checkpoint

原始 PR · 作者 guapisolo · 合并时间 2026-09-01 04:13

测试 重要性 3.46 洞察度 2.00

Qwen3.6 会话测试改用 FP8 检查点,验证目标不变

该 PR 不值得精读,可快速合并。值得注意的设计原则是“验证目标优先于 artifact 选择”——在 CI 面上用更轻量的检查点保持等价覆盖,而非削弱验证范围。若想理解 TITO Qwen3.6 支持的全貌,建议阅读上游 PR #2759(引入 tito_tokenizer、qwen3.6_fixed.jinja 模板与 test_qwen36.py)。

功能 重要性 6.93 洞察度 5.00

Qwen3.8 系列新增双 TITO 家族名共享固定渲染模板

值得精读,重点看三处设计决策:(1) 两个公共枚举映射到同一个 tokenizer 类的工厂写法,如何避免复制 renderer;(2) 固定默认 reasoning 模式并显式拒绝冲突 kwargs 的保护机制,防止缓存前缀静默失配;(3) FIXME 驱动的临时行为显式化,为后续 request-argument 优先级重构留出清晰的演进路径。若团队要新增类似“共享序列化契约、不同公共名”的模型家族,可直接复用本 PR 的模式。

缺陷修复 重要性 7.70 洞察度 5.00

disk-delta 基线校验张量 dtype/形状,拒绝非规范布局

值得精读。核心设计是“规范化校验前置 + 集合通信错误同步”:在分布式训练中,source rank 的校验错误不能立即抛出(会中断 collectives),通过 `all_gather_object` 聚合后再统一失败,是一个可复用的模式。dtype 映射表的做法(safetensors 不暴露 torch dtype 编码器)也值得注意。建议关注点:移除 fallback 后的兼容性边界、未来新 dtype 的扩展点、以及错误聚合的通信开销。

参与讨论