Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

distributed 相关 PR

2026-08-19
文档 重要性 4.72 洞察度 3.00

修正 initialize_model_parallel 并行组布局 docstring

不值得精读,但可作为 API 文档纠错的快速参考。值得关注的设计决策是:作者通过补充 `attn_tp_size = tp_size // attn_cp_size // attn_dp_size` 推导公式,让文档结论可以被计算验证,而不仅仅是改一行描述;这种用公式支撑示例的写法可以推广到其他并行布局说明中。

2026-08-17
缺陷修复 重要性 6.01 洞察度 4.00

修复 world size 1 下 MLP 批同步缓冲区别名问题

该 PR 值得精读。虽然改动仅一行核心变更,但它揭示了一个常见的 PyTorch 陷阱:`expand()` 返回的视图在已连续时,`contiguous()` 不会拷贝存储。对于编写分布式同步逻辑的工程师,这是一个很有教育意义的案例。建议阅读 `all_gather` 的整体流程,理解为何 `repeat` 是正确选择,并留意未来在类似场景中避免使用 `expand().contiguous()` 构造共享存储。

2026-08-11
缺陷修复 重要性 5.67 洞察度 4.00

TMS 下 AITER reduce-scatter 改用未注册路径,修复 CUDA 图捕获崩溃

值得快速浏览:修复点虽小但切中一个真实崩溃场景,且与已有 all-gather 修复模式一致。建议后续补充 TMS + ROCm 组合的单元测试或回归用例,避免该路径再次漂移。

2026-08-07
功能 重要性 6.10 洞察度 6.00

为进程组新增 group_desc 语义元数据,供诊断工具区分 TP/PP

值得快速精读,尤其关注测试设计:从 mock 断言到真实 new_group 读回的演进,体现了“用实现验证实现”的同义反复陷阱以及回归守卫的正确写法。代码改动本身很小(+7/-1),但作为分布式可观测性元数据约定({group_name}:device/cpu),对后续 NCCL Inspector 等工具链有实际价值。

2026-07-22
重构 重要性 7.01 洞察度 4.00

集中 Mooncake PG 配置到传输引擎模块

值得精读的设计决策,特别是将依赖集中并通过初始化顺序保证共享实例的模式。建议关注 _resolve_backend 的简化以及 TE 初始化时机的选择。

2026-07-17

#30164 [1/N] elastic-ep: Add runtime EP scale-up

原始 PR · 作者 zackyoray · 合并时间 2026-07-17 06:53

功能 重要性 9.36 洞察度 7.00

运行中 MoE EP 规模动态扩展,不重启添加 GPU ranks

值得精读,尤其关注 `ElasticEPStateManager` 状态机、`maybe_join_ep_ranks` 中的生命周期管理、以及数据平面(NIXL、EPLB、DP attention)的协同更新。但需注意当前存在的遗留限制(空集群阻塞、超时非集体等),建议跟踪后续 PR 的修复。设计上复用现有弹性 EP 恢复机制是一个好的演进方向。

2026-07-04
缺陷修复 重要性 6.20 洞察度 4.00

禁用跨节点 TP 的 logits multimem all-gather

该 PR 修复了多节点 TP 部署的阻塞性问题,代码简洁,审查充分,建议快速合入。无需精读,但设计模式(在构造函数中禁用跨节点路径)值得在类似场景中复用。

2026-07-01
缺陷修复 重要性 5.73 洞察度 7.00

修复 custom all-reduce v2 在 torch memory saver 下 CUDA graph 捕获失败

小而关键的 bugfix,值得精读其讨论以理解 CUDA graph 捕获和 TMS 交互的细节。建议 reviewer 关注 C++ 侧 `m_is_graph_capturing` 语义的理解。