Prhub

radixark/miles · 标签视图

标签列表

聚合结果

performance 相关 PR

2026-09-01
性能优化 重要性 6.89 洞察度 5.00

gpu 模式重排交接顺序,缓解 GB300 主机内存峰值

值得精读。核心看点是 `train.py` 中 handoff 重排的先后顺序论证,以及 `rollout_manager` 细粒度 offload API 如何与 `offload_rollout_level` 配合达到语义自洽。由于没有单测,建议结合 #2706 的 e2e 验证上下文阅读,并关注后续是否补强测试,尤其是 `cpu` 模式下 `onload_weights` 新增 guard 的兼容性测试。

缺陷修复 重要性 7.70 洞察度 5.00

disk-delta 基线校验张量 dtype/形状,拒绝非规范布局

值得精读。核心设计是“规范化校验前置 + 集合通信错误同步”:在分布式训练中,source rank 的校验错误不能立即抛出(会中断 collectives),通过 `all_gather_object` 聚合后再统一失败,是一个可复用的模式。dtype 映射表的做法(safetensors 不暴露 torch dtype 编码器)也值得注意。建议关注点:移除 fallback 后的兼容性边界、未来新 dtype 的扩展点、以及错误聚合的通信开销。

2026-08-31
性能优化 重要性 7.79 洞察度 6.00

policy 前向保留模型精度,按块上转 FP32 省显存

值得精读。核心看点是“延迟上转”模式:把整张 logits 的 FP32 物化推迟到 chunk 粒度,配合 Megatron `fp32_output` 开关实现显存近一个数量级的下降;另一个值得借鉴的细节是把温度缩放放到 FP32 上转之后再做,避免模型精度下的舍入误差,并用 atol=1e-6 的等价性测试固化。fp16 placeholder 的 `sum(dtype=torch.float32)` 防溢出写法也建议在其它 loss 占位处复用。若团队后续要统一 1F1B 路径,可参考本 PR 的 `fp32_output` 透传设计。

2026-08-30
性能优化 重要性 6.57 洞察度 7.00

清空 TE 量化缓存,offload 省 45% 主机内存流量

本 PR 值得精读。diff 极小(+32/-1),但有两层学习价值:一是 PR body 展示了如何用“每元素字节数 × 模块数”做理论测算并与实测对照(91%/96% 兑现率),并清晰量化了 MXFP8 与 NVFP4 两种布局的成本差异;二是评审者的收敛过程说明——默认开启的开关配 assert 会误伤无关配置(bf16 + CUDA graphs),以及跨后端共享工具中 Megatron 特定逻辑的放置取舍。可作为 offload 前释放派生缓冲的性能优化参考模板。

2026-08-29
功能 重要性 6.38 洞察度 6.00

令牌条改为整条滚动,分页控件移除,请求减半

值得精读,尤其是关心 dashboard 前端与超长列表渲染的工程师。作者先用实测证明 DOM 构建成本远低于直觉(64k span 仅 66 ms),再用 `offsetParent + scrollTop` 的懒定位替代分页状态,最后针对 review 发现的隐藏面板时序问题设计一次性 `_onShown` 回调;这三个决策都可迁移到其他长列表或懒加载面板场景。

#2739 feat: dist_muon offloading in megatron

原始 PR · 作者 Zhichenzzz · 合并时间 2026-08-29 09:16

功能 重要性 9.03 洞察度 7.00

为 Muon 优化器新增 NVMe 磁盘状态卸载,规避主机 OOM

值得精读。核心设计决策有三个:其一,不重写 DistOpt 分桶/写回逻辑,而是子类化 `ChunkedOptimizerStateOffloader` 只覆盖分配器,用最小改动复用 Megatron 既有的 chuncked restore、`assert_master_weights_resident` 和 prefetch 钩子;其二,利用文件页可回收性而不是简单扩内存,从内核语义上解决 OOM;其三,用 tensor 标记 + `msync` 与 Megatron checkpoint 协议对齐,避免全量重分配和不可归因的写回。这些模式对任何“把显存/内存压力转移到磁盘”的需求都有借鉴价值。

2026-08-28
缺陷修复 重要性 4.89 洞察度 4.00

修复 swe-agent 中止时未刷新多个 session-server 实例的问题

此 PR 值得精读,因为它修复了一个性能关键路径上的 bug,并展示了如何正确读取 driver 参数中的复数映射。建议补充针对 abort 行为的单元测试,以覆盖多实例和单实例场景。

2026-08-23
功能 重要性 9.36 洞察度 8.00

RDT/NIXL 零拷贝权重同步:GPU 直传较 NCCL 提速 2 倍

值得精读。这不仅是功能新增,更是一份「零拷贝跨进程/跨节点 GPU 传输」的工程教材:VMM expandable_segments 与 CUDA-IPC 导出的冲突、NIXL 注册生命周期与远端缓存失效的关联、EFA 小 MR 走 host bounce pool 的假阳性探测、以及 Ray concurrency group 导致的主线程外执行语义,每一个都是只有实测才能发现的坑。建议重点研读 `update_weight_from_rdt.py` 的桶分配 / 钉扎 / 分轮逻辑、`actor_factory.py` 的 max_concurrency 分析(配合 guapisolo 对 Ray 2.56 的源码追踪评论),以及 sglang#34621 的 actor 命名稳定化设计。