Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 19:08 同步状态:空闲 下次计划:2026-09-01 20:08

PR 列表

更多筛选
2026-08-29

#36920 Add configurable HTTP/2 connection window

原始 PR · 作者 ekzhang · 合并时间 2026-08-29 13:18

功能 重要性 6.09 洞察度 5.00

新增可配置 HTTP/2 连接窗口参数

该 PR 值得精读,尤其是对负责部署和调优 SGLang 服务端性能的工程师。核心关注点是参数命名、校验范围和传递链路的设计,以及如何与现有 HTTP/2 配置相结合。

性能优化 重要性 9.34 洞察度 7.00

DCP1→N 传输打包成连续 RDMA 块,TTFT 最高降 39%

值得精读。核心看点:把 descriptor-bound 的传输瓶颈重新建模为带宽问题;`try_pack_dcp_src` 的 stream 同步与 fallback 设计;NIXL 异步读取与 chunk barrier 的配合方式;以及按 DCP rank 固定分区来支持并发异步提交的思路。建议重点阅读 `dcp_pack.py` 与 `nixl/conn.py::transfer_worker` 两处,理解 buffer 生命周期与同步语义后再评估是否移植到 DSPARK。

#35758 qwen 3.8 rebase

原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-08-29 11:41

功能 重要性 9.48 洞察度 7.00

引入 Qwen3.5 模型支持,升级 FlashInfer 0.6.18 集成

值得精读。这是理解 SGLang 如何与 FlashInfer 深度集成的重要样例,尤其是:1) `FlashInferMNNVLCuteDSLARFusion` 工作区的图稳定性设计;2) `gdn_flashinfer.py` 中 32 字节对齐与 Triton 回退的权衡;3) `_finish_mlp_output` 的 deferred-finalize 数据契约;4) `overlap_utils.py` 中一次初始化缺陷的发现与修复过程。

性能优化 重要性 7.52 洞察度 6.00

NPU KDA 改用 causal_conv1d 原位回滚方案,推理提速约 16%

值得精读。该 PR 展示了硬件后端性能优化中一个典型设计权衡:用"原位写入 + 回滚"替代"中间快照 + 散射",并通过统一内存布局换取算子复用。重点关注 `_get_conv_weights_t` 的 dtype 缓存设计(首次 dtype 固定缓存的隐患)以及 `conv_states_shape` 转置与共享 KDA 后端的耦合点。建议后续补充 conv state 回滚正确性单测和不同 dtype 调用覆盖。

#36940 [NPU] [DOC] udpate supported features on NPU

原始 PR · 作者 amote-i · 合并时间 2026-08-29 10:52

文档 重要性 3.56 洞察度 3.00

更新 NPU 支持模型与特性文档

值得文档维护者关注,作为 NPU 文档同步的参考。可精读以了解当前 NPU 支持边界。

缺陷修复 重要性 6.38 洞察度 5.00

修复 CPU 后端双向注意力被误加因果掩码

值得精读,尤其是内核 stage-2 循环中 `num_keys` 计算与掩码条件如何用一个 `is_causal` 布尔参数同时支持因果与双向两种模式,以及 C++ 内核与 Python 后端之间参数透传的完整链路(声明、schema 注册、backend 调用、测试接线)。该 PR 是理解 SGLang 后端抽象层如何对齐不同硬件实现(CPU AMX 与 Triton)的较好样例;如果你的团队维护 CPU 或注意力后端,建议同步关注测试覆盖缺口。

参与讨论