#7485 [megatron] fix: align DDP gradient dtype with optimizer precision
原始 PR · 作者 Mecoli1219 · 合并时间 2026-08-21 10:38
DDP 梯度精度对齐优化器,消除 BF16 训练内存浪费
值得精读。这是「默认值继承陷阱」的典型案例:一个被省略的配置项让框架默认值悄悄改变了训练内存布局。最小 diff(+10/-12)修复真实缺陷,设计上采用 FP32-by-default + 显式 override 优先的合成策略,可复用到其他后端配置推导(如 FSDP 的 reduce_dtype)。测试中用 `object.__new__` 绕过重型初始化的技巧,适合在依赖复杂的引擎类上做轻量单测时借鉴。
参与讨论