清空 TE 量化缓存,offload 省 45% 主机内存流量
本 PR 值得精读。diff 极小(+32/-1),但有两层学习价值:一是 PR body 展示了如何用“每元素字节数 × 模块数”做理论测算并与实测对照(91%/96% 兑现率),并清晰量化了 MXFP8 与 NVFP4 两种布局的成本差异;二是评审者的收敛过程说明——默认开启的开关配 assert 会误伤无关配置(bf16 + CUDA graphs),以及跨后端共享工具中 Megatron 特定逻辑的放置取舍。可作为 offload 前释放派生缓冲的性能优化参考模板。