Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 20:03 同步状态:空闲 下次计划:2026-09-01 21:03

PR 列表

更多筛选
2026-08-13
文档 重要性 3.64 洞察度 3.00

修复 examples 各 README 死链、列表结构与缺失条目

本 PR 值得 5 分钟快速浏览 diff:它是“文档内容为自动化铺路”的干净范例,也是 stacked PR 顺序管理(#2482 先行、#2481 重定向 main 后跟上)的直观教材。对文档维护者,`examples/README.md` 作为 meta description 来源的写法值得借鉴。对工程师而言,真正值得精读的是 #2481 的 `scripts/tools/sync_example_docs.py` 生成器——它把死链、H1、描述长度变成机器可检查的契约,本 PR 只是这份契约的输入整理。

功能 重要性 6.67 洞察度 6.00

新增单机 Qwen3-4B PPO 可运行示例与文档

值得精读。重点看 examples/ppo/README.md 的 Constraints 和 Which numbers here are verified 两节,以及 run_qwen3_4b_ppo.py 中注释串联的 PPO 参数设计:critic 共置、loss 级 KL、每 GPU 一个 engine 等决策都有明确理由。想在单机上跑 PPO 的团队可以直接以此为起点;后续接入官方文档时也建议保留这些约束说明。

功能 重要性 5.58 洞察度 6.00

新增 GLM-5.2 744B LoRA agentic 多节点启动器示例

值得精读,尤其是对多节点 LoRA + agentic 训练且基础模型超过单机显存的用户。脚本中的 DSA 后端选择(tilelang vs megatron)、磁盘 offload 与 allocator env 设置均附有详细注释,设计决策清晰,可作为编写其他大型模型启动器的范本。

缺陷修复 重要性 3.84 洞察度 4.00

修复 docs 表格被 max-content 裁剪,改为自动换行

值得快速浏览而非精读:变更本身只有 24 行 CSS,但 PR body 的“问题根因 - 全站审计 - 修复 - 残余风险披露”结构是高质量文档修复的范例,其中 unlayered 选择器覆盖 Mintlify layered utility 的技巧和 headless Chrome 批量截图验证方法可复用到其他样式类问题。建议关注作者对残余风险(隐藏滚动条)的诚实说明,以及未来对 p2p benchmark 表做列精简的 follow-up。

#2478 docs: rewrite INT4 QAT guide

原始 PR · 作者 nanjiangwill · 合并时间 2026-08-13 04:13

文档 重要性 4.43 洞察度 4.00

重写 INT4 QAT 指南,修正 W4A16 训练路径描述

值得精读。该 PR 虽然只改一个文档文件,但准确区分了“训练时 fake 量化”与“rollout 时 packed 存储格式”两组易混淆概念,并明确了 Megatron Bridge 的双向打包职责与 `OPEN_TRAINING_INT4_GROUP_SIZE` 的独立语义。对理解 miles 的 INT4 QAT 架构、Kimi-K2.5 初始化路径以及 Qwen 路径的 group size 现实差异,都是最直接的一手资料;也适合作为文档审计类 PR 的范本。

功能 重要性 8.83 洞察度 7.00

advisory v2 以健康告警优先,门控并抑制误导性调优建议

值得精读。核心设计决策值得学习:按“主张”分层 + 告警门控调优;stall watchdog 用自身中位数基线且对“常开相位”不作主张;counter 差分容忍引擎重启;缺失数据与退化组的语义区分。建议读者关注评审中 DumpStillWriting 边界是否跟进,以及 follow-up 的 per-dp-rank 标签粒度问题。

#2023 dashboard: dp-aware engine metrics

原始 PR · 作者 yueming-yuan · 合并时间 2026-08-13 02:13

功能 重要性 8.75 洞察度 7.00

引擎指标按 dp rank 正确折叠聚合,新增不均衡告警

值得精读。核心看点:(1) 指标聚合时机——折叠必须早于 rate/mean 派生,否则跨 rank diff 全是垃圾值;(2) 强度型 vs 累计型指标的差异化聚合(均值 vs 求和);(3) 告警与运行配置联动的 _dp_spread_hint 设计,让告警直接指出当前 run 真正生效的开关;(4) 与 #2022 全窗口缓存合并时把缓存键升级为 (metric, per_dp_rank) 的并发正确性处理。tests/fast/dashboard/test_engine_dp.py 是这套聚合语义的极好文档,值得作为后续指标聚合改动的测试模板。

缺陷修复 重要性 6.20 洞察度 4.00

清零 loss 掩码位置的 train log-probs,修复 token 视图误导

值得精读。本 PR 虽然改动很小,但解决了一个典型的“占位值污染可视化”问题,展示了如何区分“真实零值”与“缺失占位”,并通过保持数组对齐的方式在展示层修复而不影响统计层。`_zero_masked` 的设计简洁可复用,是 dashboard 数据展示层的一个好范例。

参与讨论