为 GPT-OSS tinygemm 路由启用 PDL
值得合并的微小优化。建议熟悉 PDL 机制的工程师了解 is_arch_support_pdl 函数的实现,以及为什么 tinygemm 路径默认没有启用 PDL。
SGLang is a high-performance serving framework for large language models and multimodal models.
为 GPT-OSS tinygemm 路由启用 PDL
值得合并的微小优化。建议熟悉 PDL 机制的工程师了解 is_arch_support_pdl 函数的实现,以及为什么 tinygemm 路径默认没有启用 PDL。
原始 PR · 作者 alphabetc1 · 合并时间 2026-06-13 04:44
统一 benchmark 延迟指标输出 p90/p95/p99 百分位
建议合并前修复 `e2e_latencies` 空列表问题,对齐 `ttfts` 等变量的防护模式——使用 `e2e_latencies or 0` 作为 `np.percentile` 的输入。该 PR 逻辑简单清晰,合并后能显著提升 benchmark 数据的完整性。
修复 FP4 KV 缓存初始化时类名引用错误
该 PR 是一次标准的 bugfix,值得快速合并。推荐所有使用 FP4 量化(如 Kimi K2.6 NVFP4)的团队关注此修复。审阅者提出的测试补充建议值得肯定,但后续应将测试文件注册到 CI 中以防止回归。
修复显式 --max-running-requests 被裁剪的问题
值得快速合并。该 PR 修复了一个影响 beam search 等场景的静默限制问题,变更极小且逻辑正确,已获两位 reviewer 批准。建议合并后通知使用 `--max-running-requests` 的团队,特别是 beam search 用户。
原始 PR · 作者 Zhichenzzz · 合并时间 2026-06-13 03:21
为 Nemotron-H 模型启用 DP attention 和 MTP
该 PR 的架构设计(通过 LayerCommunicator 解耦布局转换)值得精读。适合关注混合模型 DP 推理、推测解码与数据并行结合的工程师。建议在集成后尽快补充单元测试和集成测试。
修复 FlashInfer SWA KV 索引导致 DFlash 坍缩
值得精读,尤其是需要在注意力后端中支持 SWA 缓存或推测解码的开发者。实现了与 TRTLLM 后端的策略统一,设计思路清晰。
为 Kimi K2.7 Code 添加部署 cookbook
该 PR 属于常规文档维护,适合需要部署 Kimi-K2.7-Code 的用户精读。交互式命令生成器组件的设计模式(options 驱动、动态 fallback)可为后续类似文档组件参考。
修复EAGLE下静态显存分数未计入draft KV缓存导致OOM
此PR是一次重要的内存管理重构,修复了长期存在的draft模型显存预算缺失问题。设计上将初始化阶段清晰分离,提高了可维护性和可预测性。建议所有使用推测解码的团队精读,尤其是`init_model_worker`的编排逻辑和各worker的`alloc_memory_pool`/`init_backends`实现。
参与讨论