修正 initialize_model_parallel 并行组布局 docstring
不值得精读,但可作为 API 文档纠错的快速参考。值得关注的设计决策是:作者通过补充 `attn_tp_size = tp_size // attn_cp_size // attn_dp_size` 推导公式,让文档结论可以被计算验证,而不仅仅是改一行描述;这种用公式支撑示例的写法可以推广到其他并行布局说明中。
标签列表
聚合结果
修正 initialize_model_parallel 并行组布局 docstring
不值得精读,但可作为 API 文档纠错的快速参考。值得关注的设计决策是:作者通过补充 `attn_tp_size = tp_size // attn_cp_size // attn_dp_size` 推导公式,让文档结论可以被计算验证,而不仅仅是改一行描述;这种用公式支撑示例的写法可以推广到其他并行布局说明中。
原始 PR · 作者 merrymercy · 合并时间 2026-08-17 15:04
修复 world size 1 下 MLP 批同步缓冲区别名问题
该 PR 值得精读。虽然改动仅一行核心变更,但它揭示了一个常见的 PyTorch 陷阱:`expand()` 返回的视图在已连续时,`contiguous()` 不会拷贝存储。对于编写分布式同步逻辑的工程师,这是一个很有教育意义的案例。建议阅读 `all_gather` 的整体流程,理解为何 `repeat` 是正确选择,并留意未来在类似场景中避免使用 `expand().contiguous()` 构造共享存储。
原始 PR · 作者 JessicaJiang-123 · 合并时间 2026-08-11 06:36
TMS 下 AITER reduce-scatter 改用未注册路径,修复 CUDA 图捕获崩溃
值得快速浏览:修复点虽小但切中一个真实崩溃场景,且与已有 all-gather 修复模式一致。建议后续补充 TMS + ROCm 组合的单元测试或回归用例,避免该路径再次漂移。
为进程组新增 group_desc 语义元数据,供诊断工具区分 TP/PP
值得快速精读,尤其关注测试设计:从 mock 断言到真实 new_group 读回的演进,体现了“用实现验证实现”的同义反复陷阱以及回归守卫的正确写法。代码改动本身很小(+7/-1),但作为分布式可观测性元数据约定({group_name}:device/cpu),对后续 NCCL Inspector 等工具链有实际价值。
集中 Mooncake PG 配置到传输引擎模块
值得精读的设计决策,特别是将依赖集中并通过初始化顺序保证共享实例的模式。建议关注 _resolve_backend 的简化以及 TE 初始化时机的选择。
运行中 MoE EP 规模动态扩展,不重启添加 GPU ranks
值得精读,尤其关注 `ElasticEPStateManager` 状态机、`maybe_join_ep_ranks` 中的生命周期管理、以及数据平面(NIXL、EPLB、DP attention)的协同更新。但需注意当前存在的遗留限制(空集群阻塞、超时非集体等),建议跟踪后续 PR 的修复。设计上复用现有弹性 EP 恢复机制是一个好的演进方向。
禁用跨节点 TP 的 logits multimem all-gather
该 PR 修复了多节点 TP 部署的阻塞性问题,代码简洁,审查充分,建议快速合入。无需精读,但设计模式(在构造函数中禁用跨节点路径)值得在类似场景中复用。
原始 PR · 作者 zyzshishui · 合并时间 2026-07-01 05:53
修复 custom all-reduce v2 在 torch memory saver 下 CUDA graph 捕获失败
小而关键的 bugfix,值得精读其讨论以理解 CUDA graph 捕获和 TMS 交互的细节。建议 reviewer 关注 C++ 侧 `m_is_graph_capturing` 语义的理解。