#29007 Fix MoE TP allreduce to use NCCL symmetric memory via in-pool output allocation
原始 PR · 作者 wangfakang · 合并时间 2026-07-15 15:06
MoE 输出分配至对称内存池,allreduce 延迟降 50%
值得精读,尤其是 `use_symmetric_memory` 上下文管理器的条件使用模式,以及通过上游分配消除下游数据复制的思路。该 PR 展示了在分布式训练/推理框架中精细控制内存分配位置以获得通信性能优化的典型方法。
参与讨论