Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-07-02
重构 重要性 8.30 洞察度 6.00

提取 VMM 可复用的跨进程句柄共享帮助函数

建议精读 `export_shareable_handles` 和 `release_mappings` 的实现,前者展示了 FABRIC->POSIX 优雅降级和全 rank 一致性保证,后者演示了 partial undo 模式。此 PR 是 CUDA driver API 封装的良好范例。

性能优化 重要性 7.81 洞察度 4.00

默认启用 FlashMLA sparse prefill,GB300 预填充吞吐提升 4-12%

建议所有 DeepSeek V4 部署升级此 PR,以自动获得预填充吞吐提升。在关键生产环境升级前,建议在目标 GPU(尤其非 GB300 架构)上运行性能回归测试。合并者和作者已充分测试 GB300 场景,但其他环境需自行验证。

功能 重要性 9.18 洞察度 7.00

为 spec draft 启用 FlashInfer 自动调优

值得精读。重点理解 `flashinfer_autotune.py` 中 `should_run_flashinfer_autotune` 的条件组合以及 `maybe_flashinfer_autotune_speculative_draft` 如何与 CUDA graph capture 交互。同时关注 `base_runner.py` 的瘦身过程,是模块提取的良好实践。

功能 重要性 9.27 洞察度 6.50

统一内存池动态分配 KV 与 Mamba 状态缓存

**建议精读**。此 PR 是 SGLang 内存管理架构的重要演进,展示了如何通过统一内存池实现灵活的资源分配。特别值得关注: - `MultiEndedAllocator` 的懒压缩策略——只重映射表而不重写引用,避免数据搬迁开销。 - cuda-graph 集成中虚拟地址预先翻译的设计,确保图中无翻译节点。 - 调度器准入控制的字节粒度预算计算,防止过度分配。 对于希望理解推理引擎内存管理的工程师而言,此 PR 提供了很好的实践案例。

#29554 Upgrading tvm-ffi/sgl-deep-gemm/tilelang

原始 PR · 作者 Fridge003 · 合并时间 2026-07-02 03:32

基础设施 重要性 7.09 洞察度 4.00

升级 tvm-ffi、deep-gemm、tilelang 依赖并适配 API

值得精读 `mega_moe.py` 中的本地实现,了解如何替换上游私有 API。同时 TileLang API 变更的适配模式可作为后续升级的参考。

缺陷修复 重要性 6.51 洞察度 6.00

修复 MXFP8 MoE 权重更新后 GPU 缓存索引脏数据问题

值得精读。该 PR 揭示了 GPU 缓存与动态权重卸载之间的典型交互问题,修复方案简洁但覆盖面完整。review 中关于性能权衡的讨论对设计类似缓存失效策略有参考价值。

参与讨论