Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 21:09 同步状态:空闲 下次计划:2026-09-03 22:09

PR 列表

更多筛选
2026-06-13

#27941 Enable PDL for GPT-OSS tinygemm router

原始 PR · 作者 mmangkad · 合并时间 2026-06-13 04:51

性能优化 重要性 5.26 洞察度 3.00

为 GPT-OSS tinygemm 路由启用 PDL

值得合并的微小优化。建议熟悉 PDL 机制的工程师了解 is_arch_support_pdl 函数的实现,以及为什么 tinygemm 路径默认没有启用 PDL。

功能 重要性 5.86 洞察度 4.00

统一 benchmark 延迟指标输出 p90/p95/p99 百分位

建议合并前修复 `e2e_latencies` 空列表问题,对齐 `ttfts` 等变量的防护模式——使用 `e2e_latencies or 0` 作为 `np.percentile` 的输入。该 PR 逻辑简单清晰,合并后能显著提升 benchmark 数据的完整性。

#28013 Fix invalid KVFP4QuantizeUtil references

原始 PR · 作者 zqzten · 合并时间 2026-06-13 04:44

缺陷修复 重要性 6.15 洞察度 3.00

修复 FP4 KV 缓存初始化时类名引用错误

该 PR 是一次标准的 bugfix,值得快速合并。推荐所有使用 FP4 量化(如 Kimi K2.6 NVFP4)的团队关注此修复。审阅者提出的测试补充建议值得肯定,但后续应将测试文件注册到 CI 中以防止回归。

缺陷修复 重要性 5.94 洞察度 4.00

修复显式 --max-running-requests 被裁剪的问题

值得快速合并。该 PR 修复了一个影响 beam search 等场景的静默限制问题,变更极小且逻辑正确,已获两位 reviewer 批准。建议合并后通知使用 `--max-running-requests` 的团队,特别是 beam search 用户。

#24955 Support Nemotron DP attention and MTP

原始 PR · 作者 Zhichenzzz · 合并时间 2026-06-13 03:21

功能 重要性 9.36 洞察度 7.00

为 Nemotron-H 模型启用 DP attention 和 MTP

该 PR 的架构设计(通过 LayerCommunicator 解耦布局转换)值得精读。适合关注混合模型 DP 推理、推测解码与数据并行结合的工程师。建议在集成后尽快补充单元测试和集成测试。

#27737 flashinfer swa kv pool fix (dflash gemma 4)

原始 PR · 作者 dcw02 · 合并时间 2026-06-13 02:35

缺陷修复 重要性 6.73 洞察度 5.00

修复 FlashInfer SWA KV 索引导致 DFlash 坍缩

值得精读,尤其是需要在注意力后端中支持 SWA 缓存或推测解码的开发者。实现了与 TRTLLM 后端的策略统一,设计思路清晰。

#28064 [Docs] Add Kimi K2.7 Code cookbook

原始 PR · 作者 mmangkad · 合并时间 2026-06-13 02:19

文档 重要性 7.40 洞察度 2.00

为 Kimi K2.7 Code 添加部署 cookbook

该 PR 属于常规文档维护,适合需要部署 Kimi-K2.7-Code 的用户精读。交互式命令生成器组件的设计模式(options 驱动、动态 fallback)可为后续类似文档组件参考。

缺陷修复 重要性 9.36 洞察度 6.00

修复EAGLE下静态显存分数未计入draft KV缓存导致OOM

此PR是一次重要的内存管理重构,修复了长期存在的draft模型显存预算缺失问题。设计上将初始化阶段清晰分离,提高了可维护性和可预测性。建议所有使用推测解码的团队精读,尤其是`init_model_worker`的编排逻辑和各worker的`alloc_memory_pool`/`init_backends`实现。

参与讨论