Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-03
重构 重要性 7.85 洞察度 6.00

三处配置不再写入已发布 ServerArgs,改为入参或 override

值得精读,特别是 flashinfer_gdn_prefill_default 纯函数化 + initialize_linear_attn_config 参数注入的写法,以及用 ratchet 测试基线来度量进程级配置写入点数量的做法;也是理解 sglang 配置分层(seed/override/readback)架构的入门样例。建议关注系列后续四个 PR 如何继续清除其余写入点。

性能优化 重要性 6.46 洞察度 5.00

重放 TCP 层 TTFT 修复,socket2 保持同步监听并启用 TCP_NODELAY

值得精读。两个设计点很有参考价值:一是用 socket2 在保持同步 bind + listen 语义的同时拿到 bind 前设置 SO_RCVBUF 的能力,绕开了 tokio reactor 依赖造成的启动竞态,这是一个「用底层 API 换取语义不变」的典型手法;二是基于内核 `tcp_rmem[1]` 默认值的量化分析来定位 TTFT 根因,性能数据扎实(含 P99 与 Python 对照)。可关注后续是否落实 reviewer 建议的 socket 参数可配置化。

#33137 [CP] Fuse zigzag attention into a single call

原始 PR · 作者 Fridge003 · 合并时间 2026-08-03 11:46

性能优化 重要性 7.09 洞察度 6.00

融合 zigzag CP 两次 TRT-LLM 注意力调用为一次

值得精读。它展示了把两次 CUDA 内核调用融合为一次的标准手法:构造合成 batch 几何(combined cu_seqlens)加行复制 page table,并在策略层用后端类型分支保护原路径。对后续 CP 性能优化和大型 PR 拆分都有参考价值。重点关注 zigzag.py 的 run_attention 分流与 trtllm_mha_backend.py 的 _trtllm_context_attn 参数扩展。

缺陷修复 重要性 5.77 洞察度 4.00

将 structural_tag 纳入语法互斥校验,拒绝冲突请求

这是一个值得精读的小型 bugfix,适合作为理解 SGLang 采样参数校验与 `grammar_manager` 约束选择机制的入口。重点阅读 `sampling_params.py` 中的 `verify()` 与测试文件中通过 `GRAMMAR_VALUES` 驱动的参数化测试写法。也可结合 Issue #31680 中的 root cause 分析(blame 追溯)学习如何定位跨模块的静默逻辑缺陷。

重构 重要性 8.04 洞察度 5.00

移除废弃 mm 驻留状态,以 use_cuda_ipc 统一设备驻留

值得精读。重点看三处设计:1) 废弃参数清理时如何把状态所有权收敛到 use_cuda_ipc 单一来源;2) `_precompute_hashes_before_cpu_transfer` 的“GPU 侧先哈希、再统一搬 CPU”模式,对依赖哈希做前缀缓存的模型很有价值;3) EPD 失败不降级而是返回 503 的防护思路。同时可学习其对客户端 / 服务端错误分类的测试设计。

缺陷修复 重要性 3.84 洞察度 5.00

修复 nvcc 13 下 topk_v2 JIT 内核编译崩溃

值得阅读。改动本身仅 7 行,但 PR body 完整记录了一次教科书式的编译器崩溃诊断:在 sglang 外独立复现 load_jit() 生成的翻译单元、二分定位触发模式、用 -Xcicc -O1 证明是优化器缺陷、并跨 nvcc 12.6 / 13.2 验证兼容性。对需要维护 JIT kernel 与多 CUDA 工具链的工程师有直接参考价值;"以按值传参副本隔离仅供写入的别名指针"的做法也是规避编译器 bug 而不改变语义的干净范例。建议关注合并后 Hopper / Blackwell 上的正确性回归结果。

性能优化 重要性 7.62 洞察度 6.00

单图 DP 视觉嵌入改 broadcast,耗时降低 7.6x

值得精读:该 PR 展示了如何用更轻量的 collective(broadcast)替换对称 all-gather,并借助手动验证脚本证明 bitwise 等价。关注点:长度计算的统一、`attn_tp_group.broadcast` 的抽象契约、以及单图分支的边界条件。建议后续补充跨后端(AMD/NPU/CPU)的 broadcast 兼容性测试。

功能 重要性 8.65 洞察度 6.00

DSPARK 折叠草案支持采样,AUTO 内存门控回退 greedy

值得精读,尤其是 `DsparkDraftSampler` 的图内采样实现和 `_resolve_folded_sampling` 的 AUTO 门控逻辑。这类"图折叠 + 采样"的设计在推测解码场景中具有代表性,greedy 与采样行的混合处理、静态缓冲区与 CUDA graph 捕获的配合方式、以及 eager accept 的降级策略都有借鉴价值。建议关注后续是否会补上针对采样路径的专项测试。

参与讨论