Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 20:03 同步状态:空闲 下次计划:2026-09-01 21:03

PR 列表

更多筛选
2026-08-11
文档 重要性 4.79 洞察度 3.00

NeMo-Gym 文档去除 fork 分支指引,改用上游 main

可快速浏览确认文档一致性,值得精读的价值有限。设计上值得留意的是:在集成外部依赖的未合入特性时,作者在文档中留下 fork 分支指引并同步标注"until it merges",在特性合入后同一 PR 内同步清理三处引用,这种"临时指引 + 上游合入即回收"的做法对维护上游敏感集成很有参考价值。

#2225 docs: trim repo README to banner and nav links

原始 PR · 作者 Shi-Dong · 合并时间 2026-08-11 06:27

文档 重要性 4.06 洞察度 3.00

README 精简为 banner 与文档站导航

建议快速浏览,不必精读。两个值得关注的设计决策:一是仓库 README 收敛为 banner + 导航的文档治理模式,适合已有独立文档站的大型项目;二是用 7 个小 commit 拆分删内容、改导航、按评审收敛措辞,方便回溯每处删除的决策依据。若要复用,可补充 CI 链接检查来覆盖本 PR 遗留的外部链接有效性风险。

文档 重要性 4.33 洞察度 5.00

新增 GLM-5.2 模型文档页并更新模型表格

值得精读以了解 GLM-5.2 在 Miles 中的启动方式与 DSA 架构约束;可作为撰写其他模型文档的模板。重点关注 §5.1 的并行分支表和 §5.3 的 SGLang 配置,以及 .gitignore 修复的细节(未锚定模式误伤文档目录的教训)。

文档 重要性 2.79 洞察度 3.00

首页模型表刷新:增新删旧并声明非穷尽

纯文档 PR,无需精读实现;体量小(1 个文件 +11/-9),建议快速浏览。值得注意的两个设计决策:一是把主页模型表从“全量承诺”改为“近期高亮 + not exhaustive 声明”,降低首页与代码库持续同步的维护成本;二是对暂无文档页的模型采用“脚本/PR 链接”过渡,属于务实的渐进式文档策略。若团队后续维护首页模型列表,可复用这套 9 个月时效线与三层链接规则。

#2298 docs: polish the Quick Start page

原始 PR · 作者 Shi-Dong · 合并时间 2026-08-11 04:05

文档 重要性 4.19 洞察度 4.00

润色快速上手文档并默认启用 Miles dashboard

值得精读。这是一次高质量的文档重构,核心看点包括:把技术解释从操作步骤中剥离并下沉到页面末尾的设计决策、CLI 命令逐 flag 换行的可读性处理、以及"先脚本 PR、后文档 PR 叠加"的协作流程。对文档维护者而言,Step N 锚点命名与 dashboard 推荐替换是后续写作的规范参考;对功能开发者而言,DASHBOARD_ARGS 的注入方式可以直接复用到其他启动脚本。

文档 重要性 2.98 洞察度 3.00

按 v0.1 清单重写首页 Core features 并同步 Advanced 索引

值得文档维护者与产品同学精读:它演示了如何把对外宣传页与版本功能清单做一次严格对齐,并展示了 docs PR 中逐条事实核查的 review 范式(CI 是否每个 PR 都跑、硬件清单是否齐全、性能数字是否可复现、provider 是否都有 in-tree 示例)。若团队依赖首页做售前或上手引导,建议后续为首页 bullet 建立指向功能清单和 examples 目录的核对清单,并顺手修复 FSDP 链接锚点问题。代码与算法团队可跳过。

功能 重要性 3.01 洞察度 2.00

Quick Start 启动脚本默认开启 Miles dashboard 遥测

值得快速浏览,但无需精读。该 PR 展示了如何在启动脚本中按参数组形式接入新特性,并遵循已有的 `<output>/dump_details` 目录约定。若关注 shell 启动脚本的可测试性,可留意该脚本未被现有快照测试覆盖,后续可考虑补上。

2026-08-10
功能 重要性 7.51 洞察度 7.00

新增 GLM-5.2 × tbench2 Daytona 16 节点参考 RL 示例

值得精读。重点关注三处:① PR body 的调优因果链(每项优化如何降低显存或提升并发重叠);② recipe 的“配置即代码”组织方式(默认值 = 参考配置 + CLI 偏差);③ 引擎 balanced/low-latency 双形态与 dp-aware 路由的耦合设计。若团队要在 GB300 上跑大规模 agentic RL,这份示例是最新起点;复用时注意核心参数与镜像日期的版本对齐,并考虑把新 launch 脚本接入快照 harness。

参与讨论