Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-07-08

#30157 Size KV pool after CUDA graph capture (opt-in)

原始 PR · 作者 cctry · 合并时间 2026-07-08 03:05

功能 重要性 9.00 洞察度 6.00

CUDA图捕获后动态调整KV缓存池大小,减少内存浪费

推荐精读本PR,涉及底层CUDA VMM实现和KV池动态调整的设计权衡。对于大规模推理服务,可评估启用以提升内存效率。注意当前opt-in状态和HND槽计算争议,建议在非默认路径下充分验证后再默认开启。

#30320 [Doc] Add LongCat 2.0 FP8 cookbook

原始 PR · 作者 BBuf · 合并时间 2026-07-08 02:48

文档 重要性 7.04 洞察度 3.00

新增 LongCat-2.0 FP8 部署 cookbook

值得阅读以了解 SGLang 配置驱动 cookbook 的模板结构。重点关注 `longcat-2.0.jsx` 中 cells 和 playgroundFeatures 的设计模式,可供其他模型 cookbook 参考。建议后续完善 MTP 说明和硬件验证。

2026-07-07

#30275 [Model] Support LongCat 2.0 FP8

原始 PR · 作者 BBuf · 合并时间 2026-07-07 19:51

功能 重要性 8.49 洞察度 5.00

支持 LongCat 2.0 FP8 模型在 8x B300 上部署与推理

本 PR 的 ngram token table 跳过掩码设计和 DSA indexer head padding 技巧值得精读;建议后续补充端到端集成测试并监控 decode 性能。

文档 重要性 3.52 洞察度 2.00

NPU 文档更新,添加新模型和参数说明

此 PR 为常规文档维护,无需深入代码审查。但值得关注的是,NPU 平台对 Prefill 上下文并行(`--enable-prefill-cp`)的支持标志着该平台在长上下文场景下的优化进展,开发者可查阅相关参数使用文档。

#30312 [NPU]Add support --pre-warm-nccl

原始 PR · 作者 loading66 · 合并时间 2026-07-07 17:17

功能 重要性 5.18 洞察度 3.00

为 NPU 平台添加 HCCL 预热支持

建议精读:该 PR 展示了如何以最小改动扩展硬件支持,值得关注 `_handle_nccl_pre_warm` 的通用适配模式。

缺陷修复 重要性 4.64 洞察度 4.00

修复 FlexKV 引入的两项 trunk 测试回归

建议快速合入以恢复 trunk CI。该 PR 体现了对代码规范(使用 `runtime_context` 而非遗留全局访问器)和测试隔离的重视,值得所有贡献者参考。

#30356 Disable FA3 sparse mask kernels by default

原始 PR · 作者 Fridge003 · 合并时间 2026-07-07 16:46

基础设施 重要性 2.42 洞察度 2.00

默认禁用 FA3 sparse mask 内核以减小 wheel 体积

变更安全且收益明确,值得快速合并。适合作为了解 sgl-kernel 编译系统的示例。

参与讨论