Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 17:43 同步状态:空闲 下次计划:2026-09-01 18:43

PR 列表

更多筛选
2026-08-04
基础设施 重要性 3.77 洞察度 4.00

Docker 定时构建增加 24h 陈旧回退

这是一个小而清晰的 CI 基础设施改进,适合快速通读以了解构建触发策略的权衡。值得关注的设计点包括:用缓存文件行号记录时间戳、仅在构建触发时写回以保证时间戳语义、旧缓存自动迁移。若后续需要调整重建周期,只需修改 `MAX_BUILD_AGE_SECONDS` 一处。

文档 重要性 4.12 洞察度 3.00

修正 grad_norm 日志为裁剪前范数

值得快速浏览,无需深入精读。可关注两点:Megatron clip_grad_norm() 的返回值语义(先计算后缩放),以及日志指标文档与 UI 提示保持一致性的维护方式。

#2043 Compact NVFP4 BF16 MoE exclusion metadata

原始 PR · 作者 zianglih · 合并时间 2026-08-04 05:48

重构 重要性 5.71 洞察度 5.00

NVFP4 转换器压缩 BF16 MoE 排除项,冗余从 3571 降至 499

值得快速精读 `tools/convert_hf_to_nvfp4.py` 的 else 分支,理解“动态 BF16 层专家折叠为容器、同时保留层前缀与容器前缀”的取舍。对维护量化转换管线的同学有参考价值;注意测试当前被 CI 禁用,合并后建议留意后续启用时机。

#2122 [tml] Inkling native LoRA support

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-04 05:15

功能 重要性 9.36 洞察度 8.00

Inkling 原生 LoRA 支持:adapter-only GRPO 全链路打通

值得精读。重点关注三类设计决策:1) 插件式 LoRA 如何绕过 Megatron-Bridge 的 PEFT 集成,通过参数标签 + 显式梯度归约保证分布式正确性;2) _pp_assemble_full_adapter 与 _repack_onto_fresh_storage 解决的多维并行 + CUDA IPC 工程问题;3) SGLang 侧 lora_target_modules=["all"] 与 virtual-experts 的搭配。建议后续跟进 EP>TP 时 native shard 的加载验证、non-colocate 引擎的 LoRA 同步,以及 42/66 层真实配置的 CI 覆盖。

#1683 [tml] Inkling model support

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-04 04:59

功能 重要性 9.36 洞察度 7.00

Inkling 模型全参数 RL 支持,含多模态与启动器

值得精读。重点看三处设计:`ops.py` 与 sglang serving bit-identical 的 fp32 内核对齐策略、`layers.py` 在 CP/SP 下对 sconv 与相对位置偏置的处理、`model.py` 的异构 Dense/MoE 层结构与两个 provider 入口。Review 中发现的三个正确性 bug(fp32 masters 顺序、`no_grad` 范围、tower 同步 gate 失效)是多模态 + 权重同步组合场景的典型陷阱,可作为后续模型接入的检查清单。

重构 重要性 5.34 洞察度 3.00

移除 14 个启动器强制 --use-miles-router,默认走 sgl-router

值得快速浏览:它是理解 miles 路由演进与“如何用一个最小 diff 改变默认行为”的干净样例。重点可看作者的范围决策——不顺手删参数、不顺手删测试,而是把“移除标志”与“退役参数”两项决策解耦,避免一个看似无害的清理 PR 吞掉大量旧路径覆盖。若想进一步行动,可后续跟进 `arguments.py` 中 `--use-miles-router` 的正式退役,以及 3 个 e2e 测试对该标志的依赖清理。

#2031 feat(fsdp): add hybrid sharding

原始 PR · 作者 Rockdu · 合并时间 2026-08-04 03:45

功能 重要性 8.05 洞察度 6.00

FSDP 后端新增混合分片,配梯度一致性测试

值得精读。重点学习 `build_fsdp_meshes` 的 `_unflatten` 用法与"逻辑 DP 域不变、仅 FSDP 分片域切分"的设计取舍,以及梯度 parity worker 的三层断言方法(参考梯度对比、跨 rank bit-exact、权重还原)。建议关注 zhihengy 后续的 FSDP + CP 支持 PR,以及 `_unflatten` 在 PyTorch 升级后的兼容性。

2026-08-03
性能优化 重要性 8.89 洞察度 6.00

OPD top-k 打分稀疏化,响应降 22.9×

值得精读,尤其 `_per_position_ids` 的布局对齐设计(prompt 空槽 + 绝对位置索引复用 `_trim_input_field`)、`parse_teacher_urls` 的 fail-fast 风格、以及 reward 日志摘要模式。建议跟进 review 遗留问题:修复 `_post_json` 的 None 超时语义、确认 `--sglang-router-request-timeout-secs` 注册情况;若计划上线 `--opd-topk-per-position`,先确认 teacher/student 均为 patched 版本,并在小规模 rollout 上比对 flat 与 per-position 的 reward 一致性。

参与讨论