Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 03:31 同步状态:空闲 下次计划:2026-09-03 04:31

PR 列表

更多筛选
2026-07-02
性能优化 重要性 7.81 洞察度 4.00

默认启用 FlashMLA sparse prefill,GB300 预填充吞吐提升 4-12%

建议所有 DeepSeek V4 部署升级此 PR,以自动获得预填充吞吐提升。在关键生产环境升级前,建议在目标 GPU(尤其非 GB300 架构)上运行性能回归测试。合并者和作者已充分测试 GB300 场景,但其他环境需自行验证。

功能 重要性 9.18 洞察度 7.00

为 spec draft 启用 FlashInfer 自动调优

值得精读。重点理解 `flashinfer_autotune.py` 中 `should_run_flashinfer_autotune` 的条件组合以及 `maybe_flashinfer_autotune_speculative_draft` 如何与 CUDA graph capture 交互。同时关注 `base_runner.py` 的瘦身过程,是模块提取的良好实践。

功能 重要性 9.27 洞察度 6.50

统一内存池动态分配 KV 与 Mamba 状态缓存

**建议精读**。此 PR 是 SGLang 内存管理架构的重要演进,展示了如何通过统一内存池实现灵活的资源分配。特别值得关注: - `MultiEndedAllocator` 的懒压缩策略——只重映射表而不重写引用,避免数据搬迁开销。 - cuda-graph 集成中虚拟地址预先翻译的设计,确保图中无翻译节点。 - 调度器准入控制的字节粒度预算计算,防止过度分配。 对于希望理解推理引擎内存管理的工程师而言,此 PR 提供了很好的实践案例。

#29554 Upgrading tvm-ffi/sgl-deep-gemm/tilelang

原始 PR · 作者 Fridge003 · 合并时间 2026-07-02 03:32

基础设施 重要性 7.09 洞察度 4.00

升级 tvm-ffi、deep-gemm、tilelang 依赖并适配 API

值得精读 `mega_moe.py` 中的本地实现,了解如何替换上游私有 API。同时 TileLang API 变更的适配模式可作为后续升级的参考。

缺陷修复 重要性 6.51 洞察度 6.00

修复 MXFP8 MoE 权重更新后 GPU 缓存索引脏数据问题

值得精读。该 PR 揭示了 GPU 缓存与动态权重卸载之间的典型交互问题,修复方案简洁但覆盖面完整。review 中关于性能权衡的讨论对设计类似缓存失效策略有参考价值。

缺陷修复 重要性 7.54 洞察度 4.00

修复 compressed-tensors WNA16 MoE 加载无 Linear 组的检查点时 KeyError

该 PR 修复了一个重要的加载阻塞 bug,建议阅读者关注其设计模式:将每层 `weight_quant` 的解析逻辑收敛在 `get_moe_scheme` 中,而不是分散在各方案构造函数中。这符合 DRY 原则,也便于未来扩展新的 MoE 量化方案。新增的回归测试同样值得参考。

参与讨论