Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 16:32 同步状态:空闲 下次计划:2026-09-01 17:32

PR 列表

更多筛选
2026-07-31

#2009 [docs] Add Inkling-Small model page

原始 PR · 作者 Zhichenzzz · 合并时间 2026-07-31 02:05

文档 重要性 3.45 洞察度 2.00

新增 Inkling-Small 276B 模型文档页

该 PR 为纯文档变更,不值得精读代码细节,但可作为了解 Inkling 系列模型支持范围的入口。值得关注的是文档中提到的 `scripts/models/inkling-small.sh` 和 `scripts/run_inkling_975b.py` 等配方文件,它们才是模型真正落地的源码载体,建议有需要时追溯这些文件。

2026-07-30
缺陷修复 重要性 6.77 洞察度 4.00

修复 dashboard 阶段可见性与空闲事件滞留

值得精读,尤其是 store.py 中 open 区间语义的处理和 hooks.py 中后台 flush 线程的设计:前者体现了“事件半开区间 + 渲染端负责延伸”的约定,后者解决批处理 sink 在静默进程上的滞留问题。建议后续为这三类场景补充针对性回归测试(open manager 事件、空 gpus 拓扑、空闲进程 flush),并将 `t1=-1` 的渲染约定写入模块文档。

功能 重要性 8.52 洞察度 7.00

启用 MoE 专家多 LoRA,扩展 (tp,pp,ep) 分片与校验

值得精读。三个设计决策有借鉴价值:(1) 用一次缓存的 gloo all-gather 获取 realized 坐标集合而非推导 `tp × pp × ep` 笛卡尔积,正确处理 ETP < TP 的稀疏拓扑;(2) rank 轴从张量末尾寻址,使同一函数同时正确服务 2-D dense 与 3-D/4-D packed 导出张量;(3) 把依赖 Megatron 解析结果的校验放在 `provider.finalize()` 之后,避免 CLI 层对 `None` 默认值的误判。配套测试(尤其 `test_completeness_ignores_unrealized_coordinates`)精准锚定了每个修复动机,适合作为回归测试范本;review 中"注释压缩到 1-2 行"的约定也体现了该仓库对可读性的要求。

缺陷修复 重要性 5.05 洞察度 5.00

DSA indexer wk 改发 bf16,修复 Blackwell 在线权重同步

该 PR 值得精读,尤其关注在线权重同步与量化格式匹配的问题。设计决策是选择直接发送 bf16 而非尝试适配 ue8m0,简化了路径且成本可接受。建议后续增加针对该场景的回归测试。

缺陷修复 重要性 6.74 洞察度 5.00

修复冻结 draft 权重同步选择器

值得精读。该 PR 展示了如何用一个单一决策函数统一权重更新覆盖范围,并通过端到端指标(spec_accept_length)验证修复效果;同时揭示了非幂等变换(AITER shuffle)在权重同步中可能引发的静默损坏,对处理分布式训练推理一致性有启发。建议关注其条件判断的扩展性,并补充针对 selector 分支的单元测试。

基础设施 重要性 3.55 洞察度 4.00

修复 CUDA12 镜像 sglang 脏树阻断发布构建

值得快速阅读,作为一个典型的“上游镜像脏树 + 依赖标记污染”CI 问题的修复案例。其价值不在于代码量,而在于对根因的完整定位:作者先确认是上游镜像构建行为导致,再论证“只用 checkout -f 不够”,必须重放 sed 改写才能避免可编辑安装元数据泄漏 cu13 标记。可关注的点是 sed 模式与上游文件耦合带来的维护成本,后续升级 sglang-miles 时需要注意同步校验。

重构 重要性 9.18 洞察度 7.00

训练样本组装移入 session server,records 不再出服务器

值得精读。该 PR 是一个典型的「传输与计算位置重构」案例:用单一 wire 契约(SAMPLES_VALUE_SPEC)把服务端计算与客户端覆盖解耦,用 deepcopy + 默认值守卫保证输入模板不被污染,并以 golden 测试锁定行为。重点关注三个设计决策:① 字段白名单 + 固定 dtype + strict 校验如何防止静默精度损失;② 超时 fail-loud 与边界 ABORT 的权衡;③ 服务端事件循环同步组装的取舍。

功能 重要性 8.75 洞察度 6.00

新增 NeMo-Gym 集成示例,agent 函数层对接 mini_swe_agent_2

值得精读。三个设计决策有借鉴价值:① agent function 层连接器的失败语义设计——传输失败返回 None 保留 session 成样、reward 兜底 0.0,未触达模型的 episode 经 check_no_aborted 整组丢弃,把"环境故障"与"模型能力不足"两类情况做了干净区隔;② 无 GPU 双层扫描验证方法论——golden 扫描以 reward 1.0 为硬门槛验证沙箱 + 镜像 + SWE-bench harness 链路,API-policy 扫描验证 policy_base_url 覆盖的端到端往返,两关都过了才上 GPU 训练,成本极低;③ 上游优先集成策略——把 per-request policy 覆盖做成上游 NeMo-Gym PR(#2166)而非 miles 侧 hack,README 明确指向 PR 分支并说明合并后如何切回上游。若团队计划继续扩展外部环境生态,此 PR 可作为第三个范式实例的模板。

参与讨论