Prhub

radixark/miles

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

监控状态:已开启 最近同步:2026-09-01 15:20 同步状态:空闲 下次计划:2026-09-01 16:20
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-30
性能优化 重要性 6.57 洞察度 7.00

清空 TE 量化缓存,offload 省 45% 主机内存流量

本 PR 值得精读。diff 极小(+32/-1),但有两层学习价值:一是 PR body 展示了如何用“每元素字节数 × 模块数”做理论测算并与实测对照(91%/96% 兑现率),并清晰量化了 MXFP8 与 NVFP4 两种布局的成本差异;二是评审者的收敛过程说明——默认开启的开关配 assert 会误伤无关配置(bf16 + CUDA graphs),以及跨后端共享工具中 Megatron 特定逻辑的放置取舍。可作为 offload 前释放派生缓冲的性能优化参考模板。

2026-08-29
功能 重要性 6.38 洞察度 6.00

令牌条改为整条滚动,分页控件移除,请求减半

值得精读,尤其是关心 dashboard 前端与超长列表渲染的工程师。作者先用实测证明 DOM 构建成本远低于直觉(64k span 仅 66 ms),再用 `offsetParent + scrollTop` 的懒定位替代分页状态,最后针对 review 发现的隐藏面板时序问题设计一次性 `_onShown` 回调;这三个决策都可迁移到其他长列表或懒加载面板场景。

#2739 feat: dist_muon offloading in megatron

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-29 09:16

功能 重要性 9.03 洞察度 7.00

为 Muon 优化器新增 NVMe 磁盘状态卸载,规避主机 OOM

值得精读。核心设计决策有三个:其一,不重写 DistOpt 分桶/写回逻辑,而是子类化 `ChunkedOptimizerStateOffloader` 只覆盖分配器,用最小改动复用 Megatron 既有的 chuncked restore、`assert_master_weights_resident` 和 prefetch 钩子;其二,利用文件页可回收性而不是简单扩内存,从内核语义上解决 OOM;其三,用 tensor 标记 + `msync` 与 Megatron checkpoint 协议对齐,避免全量重分配和不可归因的写回。这些模式对任何“把显存/内存压力转移到磁盘”的需求都有借鉴价值。

2026-08-28

#2790 Bump flash-linear-attention to 0.5.2

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-28 13:13

基础设施 重要性 2.94 洞察度 4.00

升级 flash-linear-attention 到 0.5.2,修复 KDA 训练崩溃

该 PR 值得精读,尤其是对于维护或使用 fla 的工程师。原因: - 它展示了一个典型依赖升级的处理方式:清晰的动机说明、明确的 A/B 验证、对 API 兼容性的确认。 - 它揭示了 triton 版本变化对 jit 代码的破坏性影响,对编写 triton 内核的开发者有警示意义。 - 对 KDA 训练相关功能而言,这是一个必要的修复,建议合并后尽快使用新镜像验证训练流程。

基础设施 重要性 5.53 洞察度 5.00

删除过时的 ROCm Megatron patch,修复镜像构建

该 PR 值得精读,尤其是了解如何处理上游依赖变更导致的构建失败。关键设计决策是删除死代码而不试图修复补丁,这基于对当前 tree 的检查。对于维护者,应关注后续是否有替代方案处理 Megatron 内部行为变化。

重构 重要性 7.91 洞察度 6.00

端口与并发数解耦,新增 workers 参数

值得精读。这是一个有清晰设计意图的破坏性 CLI 重构:默认 32 workers 的取舍、拒绝旧语法而非兼容、TODO(#1837) 标记临时端口分配,都体现了对“配置属主唯一”和“迁移可见性”的坚持。建议重点关注 _resolve_session_server_ports 的实现与 review 中未解决的连续端口占用问题,后续很可能被 #1837 的统一端口分配重构取代。

#2765 feat(metrics): log per-rollout response lengths

原始 PR · 作者 Shi-Dong · 合并时间 2026-08-28 05:54

功能 重要性 7.00 洞察度 6.00

新增 per-rollout 响应长度指标,覆盖 compaction 场景

值得精读。该 PR 展示如何在指标层正确处理 session compaction 的语义(sibling 求和避免重复计数),以及如何通过统一的 episode identity 辅助函数同时修复既有 bug 并支撑新功能;review 中 P1/P2 都是真实可复现的指标错误,修复思路与测试覆盖值得借鉴。

缺陷修复 重要性 4.89 洞察度 4.00

修复 swe-agent 中止时未刷新多个 session-server 实例的问题

此 PR 值得精读,因为它修复了一个性能关键路径上的 bug,并展示了如何正确读取 driver 参数中的复数映射。建议补充针对 abort 行为的单元测试,以覆盖多实例和单实例场景。

参与讨论