Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 16:32 同步状态:空闲 下次计划:2026-09-01 17:32

PR 列表

更多筛选
2026-08-25
重构 重要性 7.68 洞察度 7.00

升级 Megatron-LM 至 20260819 并全面适配 API 变更

值得精读。这是"大版本依赖升级如何控制风险面"的样板:以 base bump only 为边界、用显式禁用隔离未适配特性、把大特性拆成 follow-up PR。重点阅读 `miles/backends/megatron_utils/arguments.py` 中的数值决策注释与 `model.py` 中 MTP loss tracker 适配模式,以及 `update_weight/common.py` 的命名正则。同时建议关注 #2734 回退 `MEGATRON_BRANCH` 的原因,评估当前 bump 是否需补丁修缮。

#2729 fix(ci): use local UCX transports for RDT test

原始 PR · 作者 guapisolo · 合并时间 2026-08-25 03:03

缺陷修复 重要性 3.99 洞察度 3.00

限制 RDT 测试使用本地 UCX 传输以修复 CI 失败

值得精读,尤其关注 `extra_env_vars` 的使用方式,可作为类似测试环境限制的参考。

2026-08-24
功能 重要性 8.31 洞察度 5.00

新增 DSV4-0731 支持与 MXFP4→FP8 转换器

值得精读,重点看 cast_e2m1fn_to_e4m3fn 的无损转换实现、e8m0fnu→float32 兼容处理,以及 rematerialize 对冻结参数的备份修复。若团队后续要接入其他 MXFP4 官方发布,可直接复用该转换器模式。

功能 重要性 9.15 洞察度 7.00

新增采样支持 log-prob 原语,为 on-policy 归一化铺路

值得精读,重点看三处设计决策:(1)`RolloutSamplingMask` 为什么用 CSR 而非嵌套结构——这是「逻辑模型 vs 传输模型」权衡的典型范本;(2)`_apply_sampling_mask` 的 inplace 与非 inplace 分流,以及 true-on-policy 下 log-prob 用 mask 而 entropy 保持全 vocab 的语义对齐;(3)`_iter_response_chunks` 如何在不破坏旧契约的前提下为 CP 各模式补充全局响应索引。建议与 #2595、#2596 一起阅读以还原完整功能闭环。

基础设施 重要性 7.50 洞察度 6.00

/rerun-test 反馈升级:同一条评论从 running 原地更新到终态

值得精读。该 PR 虽然只涉及 CI 基础设施,但其设计决策具有可迁移性:状态评论的 ownership 归属(run 自持而不是 gateway 代发)、comment ID 跨 job 传递、`always()` finalizer 汇总多 job 结果、以及结果映射的 fail-closed 语义,都是构建可靠的 PR 评论机器人的良好范本。尤其推荐关注 `_file_run_status_inputs` 的严格入参校验与 `_file_run_outcome` 的终态映射,这两处体现了“宁可报失败也不静默”的工程原则。

2026-08-23

#2716 fix: align MLA RoPE types with model configs

原始 PR · 作者 zyzshishui · 合并时间 2026-08-23 19:14

缺陷修复 重要性 5.06 洞察度 5.00

为 GLM-4.7-Flash 与 JoyAI-LLM-Flash 显式声明 plain RoPE,修复 MLA 误用 YaRN

值得精读,尤其适合关注模型配置契约与训练框架隐式默认值交互的读者。本 PR 虽然只有 +12 行的最终改动,但完整呈现了一个隐蔽的配置错配 bug 的根因链条:模型定义遗漏参数 → 参数加载原样传递 → Megatron 侧隐式兜底 → 运行时构造错误的嵌入实现。值得借鉴的两个设计决策:一是“显式优于隐式”,在框架存在默认值填充逻辑时,模型定义应显式声明;二是合并前的 split-scope 纪律,未验证的 GLM-5 部分被果断剥离,避免把不确定性的风险带入主分支。

功能 重要性 9.36 洞察度 8.00

RDT/NIXL 零拷贝权重同步:GPU 直传较 NCCL 提速 2 倍

值得精读。这不仅是功能新增,更是一份「零拷贝跨进程/跨节点 GPU 传输」的工程教材:VMM expandable_segments 与 CUDA-IPC 导出的冲突、NIXL 注册生命周期与远端缓存失效的关联、EFA 小 MR 走 host bounce pool 的假阳性探测、以及 Ray concurrency group 导致的主线程外执行语义,每一个都是只有实测才能发现的坑。建议重点研读 `update_weight_from_rdt.py` 的桶分配 / 钉扎 / 分轮逻辑、`actor_factory.py` 的 max_concurrency 分析(配合 guapisolo 对 Ray 2.56 的源码追踪评论),以及 sglang#34621 的 actor 命名稳定化设计。

参与讨论