新增 DWDP 并行策略,消除 MoE prefill 跨 rank 同步
此 PR 实现了一个重要的分布式并行策略,设计精巧(CUDA VMM 复合 VA、double-buffered prefetch),性能收益突出。建议精读 `vmm.py`、`layout.py` 和 `weight_manager.py` 的设计。但需注意非 CUDA 平台的兼容性问题,建议在后续 PR 中优先修复 import 延迟。综合评分:重要度 8(重大变更),洞察价值 7。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增 DWDP 并行策略,消除 MoE prefill 跨 rank 同步
此 PR 实现了一个重要的分布式并行策略,设计精巧(CUDA VMM 复合 VA、double-buffered prefetch),性能收益突出。建议精读 `vmm.py`、`layout.py` 和 `weight_manager.py` 的设计。但需注意非 CUDA 平台的兼容性问题,建议在后续 PR 中优先修复 import 延迟。综合评分:重要度 8(重大变更),洞察价值 7。
原始 PR · 作者 JINO-ROHIT · 合并时间 2026-07-21 14:58
修复 SM120 设备上 MoE tile scatter 回退
该 PR 解决了一个明确的兼容性问题,但模块级别的 CUDA 上下文初始化存在潜在风险。建议后续提交一个惰性初始化的优化 PR 来解决该问题。整体上值得合入。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-07-21 14:51
为 AMD 新增 2 个 JIT kernel 基准测试注册
可快速合并。作为 CI 基础设施的例行扩展,无需精读。
原始 PR · 作者 iridiumine · 合并时间 2026-07-21 09:16
为 NPU 适配 MiMo-V2.5-W8A8,添加量化配置回退和测试覆盖
该 PR 变更虽小,但展示了在量化配置兼容性处理上一种简洁的 fallback 模式,值得类似场景参考。新增的集成测试配置完整,可作为 NPU 模型新适配的模板。建议在类似量化路径重构时考虑更统一的错误处理。
原始 PR · 作者 rahulvijayaraghavan · 合并时间 2026-07-21 09:09
XPU 启用可分段 prefill CUDA 图
值得精读。该 PR 展示了如何通过 `get_device_module()` 实现设备无关的图形捕获原语,设计模式清晰。对于关注多硬件适配或 Intel XPU 推理的开发者有直接参考价值。
修复 CPU 上 MXFP4 权重的 padding 尺寸
值得合并,修复明确且简洁。建议后续增加针对 MXFP4 + CPU AMX 的回归测试。
原始 PR · 作者 paulzhang-tm · 合并时间 2026-07-21 09:01
保留自定义op边界的注意力 LSE 以支持分段前缀 MHA
此 PR 实现了 FullCG 中 LSE 传递的关键机制,是 Chunked-prefix MHA 功能的基础。建议相关开发者精读 `radix_attention.py` 中的操作注册和 forward 逻辑。值得关注的设计决策是将 LSE 操作作为独立注册操作,避免破坏现有接口。
修复 grammar 约束推测解码时停止边界错误
建议精读。本 PR 虽小,但揭示了在多重停止条件下正确确定完成边界的通用设计问题,且 review 中关于 Future 守卫的讨论体现了对生命周期不变量的深刻理解,值得参考。
参与讨论