默认启用 FlashMLA sparse prefill,GB300 预填充吞吐提升 4-12%
建议所有 DeepSeek V4 部署升级此 PR,以自动获得预填充吞吐提升。在关键生产环境升级前,建议在目标 GPU(尤其非 GB300 架构)上运行性能回归测试。合并者和作者已充分测试 GB300 场景,但其他环境需自行验证。
SGLang is a high-performance serving framework for large language models and multimodal models.
默认启用 FlashMLA sparse prefill,GB300 预填充吞吐提升 4-12%
建议所有 DeepSeek V4 部署升级此 PR,以自动获得预填充吞吐提升。在关键生产环境升级前,建议在目标 GPU(尤其非 GB300 架构)上运行性能回归测试。合并者和作者已充分测试 GB300 场景,但其他环境需自行验证。
为 spec draft 启用 FlashInfer 自动调优
值得精读。重点理解 `flashinfer_autotune.py` 中 `should_run_flashinfer_autotune` 的条件组合以及 `maybe_flashinfer_autotune_speculative_draft` 如何与 CUDA graph capture 交互。同时关注 `base_runner.py` 的瘦身过程,是模块提取的良好实践。
统一内存池动态分配 KV 与 Mamba 状态缓存
**建议精读**。此 PR 是 SGLang 内存管理架构的重要演进,展示了如何通过统一内存池实现灵活的资源分配。特别值得关注: - `MultiEndedAllocator` 的懒压缩策略——只重映射表而不重写引用,避免数据搬迁开销。 - cuda-graph 集成中虚拟地址预先翻译的设计,确保图中无翻译节点。 - 调度器准入控制的字节粒度预算计算,防止过度分配。 对于希望理解推理引擎内存管理的工程师而言,此 PR 提供了很好的实践案例。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-07-02 03:57
为 AMD CI 注册 3 个 unit/mem_cache 测试
值得阅读以了解如何将测试注册到 AMD CI 中。对于关注 AMD 平台测试覆盖的开发者尤其相关。
原始 PR · 作者 michaelzhang-ai · 合并时间 2026-07-02 03:56
修复 AMD 上 int8 量化 Triton 内核编译错误
值得精读。本 PR 展示了如何在不破坏 CUDA 路径的前提下,优雅地解决 Triton 内核在 AMD/ROCm 上的可移植性问题。使用 `tl.constexpr` 分支消除的模式可复用。
升级 tvm-ffi、deep-gemm、tilelang 依赖并适配 API
值得精读 `mega_moe.py` 中的本地实现,了解如何替换上游私有 API。同时 TileLang API 变更的适配模式可作为后续升级的参考。
修复 MXFP8 MoE 权重更新后 GPU 缓存索引脏数据问题
值得精读。该 PR 揭示了 GPU 缓存与动态权重卸载之间的典型交互问题,修复方案简洁但覆盖面完整。review 中关于性能权衡的讨论对设计类似缓存失效策略有参考价值。
修复 compressed-tensors WNA16 MoE 加载无 Linear 组的检查点时 KeyError
该 PR 修复了一个重要的加载阻塞 bug,建议阅读者关注其设计模式:将每层 `weight_quant` 的解析逻辑收敛在 `get_moe_scheme` 中,而不是分散在各方案构造函数中。这符合 DRY 原则,也便于未来扩展新的 MoE 量化方案。新增的回归测试同样值得参考。
参与讨论