Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 22:27 同步状态:空闲 下次计划:2026-09-03 23:27

PR 列表

更多筛选
2026-06-12

#27826 Optimize FLUX.1 tensor parallel sharding

原始 PR · 作者 mickqian · 合并时间 2026-06-12 13:13

性能优化 重要性 9.16 洞察度 6.00

优化 FLUX.1 的 TP 分片,2GPU 延迟降低 35%

PR 的核心设计决策(保留 Nunchaku 路径、权重分片加载)值得关注,适合对扩散模型 TP 优化感兴趣的工程师精读。mask 注意力 GQA 修复和 overlay 缓存完善也具有通用参考价值。

#25954 add LRU eviction for mooncacke embedding cache

原始 PR · 作者 QiuMike · 合并时间 2026-06-12 12:38

功能 重要性 8.93 洞察度 6.00

为 Mooncake Embedding Cache 添加 LRU 淘汰机制

该 PR 值得精读,尤其是引用计数设计、锁策略以及与 RDMA 异步操作的交互。展示了如何在缓存系统中安全地添加逐出而不破坏在途 I/O,对类似系统的缓存实现有参考价值。

功能 重要性 8.59 洞察度 6.00

为 Ascend NPU 添加 Gemma4 SWA 支持

该 PR 是 Ascend NPU 后端支持混合滑动窗口注意力的重要里程碑,涉及 mask 生成、图模式支持、回退路径增强、语义对齐等多层面改动。代码质量较高,设计决策清晰(如窗口约定转换、图模式预分配策略),评测数据充分。建议关注 SWA 路径在图模式下的性能表现和测试覆盖的持续性。值得精读,尤其是 `ascend_backend.py` 中 `_init_cuda_graph_metadata` 的 mask 更新逻辑和 `ascend_torch_native_backend.py` 的窗口裁剪实现。

#27956 Use the correct wrapper for `fp4_quantize`

原始 PR · 作者 b8zhong · 合并时间 2026-06-12 11:23

缺陷修复 重要性 5.34 洞察度 3.00

修复 NVFP4 量化使用错误的 flashinfer 接口

该 PR 是典型的微调修复,技术复杂度低,但解决了实际运行中的量化分支错误。建议 CI 增加对 cute-dsl 后端的量化测试。

#27409 add lfm2.5 to new cookbook.

原始 PR · 作者 vincentzed · 合并时间 2026-06-12 11:08

文档 重要性 7.65 洞察度 4.00

添加 LiquidAI LFM2.5 部署文档与基准配置

建议读者重点了解 config-driven 的 cookbook 实现模式,以及如何通过 snippets 和组件统一管理模型配置和基准数据。关注 LiquidAI 模型的用户可直接参考该页面了解部署细节和性能表现。

重构 重要性 7.22 洞察度 6.00

get_default_distributed_backend 委托平台接口

值得所有涉及分布式初始化和平台插件的开发者精读。本 PR 展示了如何将核心组件迁移到插件友好接口而不破坏向后兼容。重点关注委托决策与 fallback 机制。

参与讨论