Prhub

radixark/miles · 标签视图

标签列表

聚合结果

ppo 相关 PR

2026-09-01
性能优化 重要性 6.89 洞察度 5.00

gpu 模式重排交接顺序,缓解 GB300 主机内存峰值

值得精读。核心看点是 `train.py` 中 handoff 重排的先后顺序论证,以及 `rollout_manager` 细粒度 offload API 如何与 `offload_rollout_level` 配合达到语义自洽。由于没有单测,建议结合 #2706 的 e2e 验证上下文阅读,并关注后续是否补强测试,尤其是 `cpu` 模式下 `onload_weights` 新增 guard 的兼容性测试。

2026-08-31
性能优化 重要性 7.79 洞察度 6.00

policy 前向保留模型精度,按块上转 FP32 省显存

值得精读。核心看点是“延迟上转”模式:把整张 logits 的 FP32 物化推迟到 chunk 粒度,配合 Megatron `fp32_output` 开关实现显存近一个数量级的下降;另一个值得借鉴的细节是把温度缩放放到 FP32 上转之后再做,避免模型精度下的舍入误差,并用 atol=1e-6 的等价性测试固化。fp16 placeholder 的 `sum(dtype=torch.float32)` 防溢出写法也建议在其它 loss 占位处复用。若团队后续要统一 1F1B 路径,可参考本 PR 的 `fp32_output` 透传设计。

2026-08-30
功能 重要性 8.26 洞察度 6.00

CSR 采样掩码表示与 rollout→trainer 传输契约落地

值得精读。重点学习两点:一是 codec 中通过 `ROLLOUT_SAMPLING_MASK_FIELDS` 从默认 allowlist 排除新字段、保持 payload 字节级向后兼容的策略;二是 CSR 掩码完整生命周期管理(append 校验、prefix 截断、merge 补观察 token、reset 清空)。建议合入前确认工具调用路径的强制 token 掩码覆盖,并在 #2596 落地 e2e 后回看数据流完整性。

2026-08-29

#2739 feat: dist_muon offloading in megatron

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-29 09:16

功能 重要性 9.03 洞察度 7.00

为 Muon 优化器新增 NVMe 磁盘状态卸载,规避主机 OOM

值得精读。核心设计决策有三个:其一,不重写 DistOpt 分桶/写回逻辑,而是子类化 `ChunkedOptimizerStateOffloader` 只覆盖分配器,用最小改动复用 Megatron 既有的 chuncked restore、`assert_master_weights_resident` 和 prefetch 钩子;其二,利用文件页可回收性而不是简单扩内存,从内核语义上解决 OOM;其三,用 tensor 标记 + `msync` 与 Megatron checkpoint 协议对齐,避免全量重分配和不可归因的写回。这些模式对任何“把显存/内存压力转移到磁盘”的需求都有借鉴价值。

2026-08-28

#2788 docs: add the GLM-5.3-Flash RL recipe page

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-28 03:44

文档 重要性 3.65 洞察度 3.00

新增 GLM-5.3-Flash RL 配方文档页并接入导航

常规文档 PR,无需精读代码,但建议:1) 用 2 分钟浏览页面结构与 #2786 的对应关系,确认命令和镜像版本;2) 在 #2786 合并时做一次同步复核,避免文档与实现漂移。值得借鉴的是「文档先行 + 版本固定 + 验证范围声明」的写法,适合作为后续新模型配方文档的模板。

文档 重要性 4.29 洞察度 4.00

新增 Qwen3.8-Flash-Next RL 配方文档页并接入导航

若在做 Qwen3.8-Flash-Next 或类似 GDN/QSA 模型的接入,值得精读该页面中“三大超纲组件”段落,尤其是 `hc_head_contraction` 与 PLE 权重更新跳过列表;其余读者快速扫过即可。值得关注的设计决策:作者将复杂技术权衡写进 recipe 而非 PR 讨论,方便后续维护者追溯实现动机。

2026-08-26
缺陷修复 重要性 5.25 洞察度 5.00

跳过非数值奖励,修复 OPD 训练崩溃

值得精读,作为处理自定义奖励函数返回非数值类型的防御性编程范例。建议阅读 `miles/ray/rollout/metrics.py` 中的 `_compute_training_sample_metrics` 函数,并考虑补充测试覆盖非数值奖励场景。

2026-08-24
功能 重要性 9.15 洞察度 7.00

新增采样支持 log-prob 原语,为 on-policy 归一化铺路

值得精读,重点看三处设计决策:(1)`RolloutSamplingMask` 为什么用 CSR 而非嵌套结构——这是「逻辑模型 vs 传输模型」权衡的典型范本;(2)`_apply_sampling_mask` 的 inplace 与非 inplace 分流,以及 true-on-policy 下 log-prob 用 mask 而 entropy 保持全 vocab 的语义对齐;(3)`_iter_response_chunks` 如何在不破坏旧契约的前提下为 CP 各模式补充全局响应索引。建议与 #2595、#2596 一起阅读以还原完整功能闭环。