Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58
后台正在同步并分析最近 PR,页面会自动刷新并逐步显示最新结果。

PR 列表

更多筛选
2026-08-02
功能 重要性 9.36 洞察度 7.00

会话感知驱逐的 Unified Radix Cache,提升 agentic 多轮命中率

值得精读。重点学习:UnifiedLRUList 的 mid/cursor 分区哨兵设计(O(1) 未引用优先驱逐)、软保护(soft-protected)与硬 pin 的语义区别、SWA 按窗口长度精确记账避免重复引用、跨组件原子驱逐保护(`_can_evict_leaf_atomically`)、以及用 session generation + closed tombstone 解决 in-flight 竞态的手法。同时留意两个已承认的 follow-up:会话引用 TTL、close 后分区切换导致的 recency 失真。

功能 重要性 6.38 洞察度 7.00

Gemma 4 MTP draft 后端支持 trtllm_mha,修复 topk>1 图尺寸越界

值得精读。核心价值不在改动量(4 文件 +19/-10),而在两处洞察:(1) 为什么 triton 一直掩盖 topk 展开后的序列数问题——`TritonAttnBackend` 从 `max_num_tokens` 推导一切,只有 trtllm_mha 把 `max_bs` 当序列数读;(2) SM100 守卫缺失导致整类测试在目标 runner 上静默跳过——测试守卫覆盖不足比没有测试更危险。建议跟进三件事:为 trtllm_mha + topk>1 补 paged tree-draft 夹具或参数化注册测试;修复 test_model_overrides.py 回归并加固属性访问;把 pyc96 提出的 server_args 层 gap 校验闭环。

功能 重要性 9.36 洞察度 7.00

Kimi K3 推理与工具调用解析及 OpenAI 服务支持

值得精读。建议关注 4 个设计点:(1) `kimik3_structural_tag.py` 的 JSON Schema → XTML 双格式翻译与 OrFormat 变体构造;(2) `KimiK3Detector`(function_call 与 reasoning_parser 两个)的流式状态机与 buffer / 游标重置契约;(3) `TokenSequenceMatcher`(KMP 前缀函数)在 grammar 回滚与多 token marker 匹配中的用途;(4) #33192 的约束失败降级策略——“不强制 JSON-only schema” 的取舍。若要接入新的专用 token 格式模型,这是当前最完整的参考实现。

#33100 [CP]: FIx some issue for glm5.2 cp v2

原始 PR · 作者 hzh0425 · 合并时间 2026-08-02 04:50

缺陷修复 重要性 6.31 洞察度 5.00

修复 GLM 5.2 DSA 模型 CP-v2 三处缺陷

值得精读。对推理引擎开发者,重点看 dsa/utils.py 的 cal_padded_tokens 与 dsa_backend.py 的 _forward_trtllm:它们清楚展示了 CP-v2(interleave 分片)与 legacy CP(split-and-rebuild)在位置语义与 padding 语义上的差异,以及如何用 is_cp_v2_active 做双路径兼容。对使用 GLM 5.2 + prefill-cp 的用户,建议在 MTP 场景观察行为并关注后续修复;对 SGLang 维护者,建议为本 PR 补充针对 per_rank_actual_token 初始化顺序的单元测试。

#33130 Disable breakable CUDA graph for NemotronH

原始 PR · 作者 b8zhong · 合并时间 2026-08-02 04:48

缺陷修复 重要性 6.02 洞察度 4.00

禁用 NemotronH 的 BCG 规避 prefill 重放精度波动

建议快速精读这一段集中式 BCG 兼容性规则表,它展示了 sglang 如何处理模型级捕获缺陷:先切配置期开关止血,再做根因修复。当前应优先与 elvischenv 确认 main 上的修复是否已覆盖 NemotronH 三个架构并补一个回滚 PR,同时补上 GSM8K 波动回归测试,避免再次踩坑。

#33026 [rust-server] fix TCP-layer TTFT stalls

原始 PR · 作者 sherlockwu · 合并时间 2026-08-02 03:13

性能优化 重要性 6.71 洞察度 7.00

修复 Rust server TCP 层两类 TTFT 卡顿

值得精读,尤其适合服务器网络编程与性能调优场景。三个值得关注的设计决策:1) 诊断先行——先用 raw-socket 探针和内核计数把问题量化到 TCP 层,再动手改代码;2) 用 tokio 原生 API(TcpSocket)而非手写 libc,降低 unsafe 面且生命周期管理更简单;3) 启动语义权衡——bind 保持同步(端口冲突是硬错误),listen 移到运行时(失败软降级),配置失败不阻断启动。建议后续补一个 raw-socket 大包探测的自动化测试或 CI 探针,防止这两类 TCP 行为悄悄回归。

性能优化 重要性 5.83 洞察度 7.00

flashinfer_deepgemm FP8 GEMM 限定在 1 <= M < 32

值得精读。这是一个小改动但论证极其扎实的 PR:用微基准、准确率实验、路由矩阵和失败模式分析支撑一个 20 行改动,并诚实地划清“性能论据为主、准确率论据为辅”的边界。值得关注的设计决策包括:单一 triton 出口折叠 M 检查、DeepGEMM 自行兜底、以及因为 DeepEP 交互问题主动回退 auto 默认。对做 kernel 调度和后端选择的工程师尤其有参考价值。

文档 重要性 4.93 洞察度 7.00

重写 runtime-context 技能文档,适配 namespace-bag 配置模型

值得精读。这份 PR 是理解 SGLang 新配置架构(RuntimeContext + namespace bags)最直接的入口,尤其适合配置系统维护者和经常被 agent 改动波及的模块 owner。重点看三处:tier 表中 raw config seed 与 resolved config 的职责切分、"Reads that legitimately stay on a ServerArgs instance" 章节(per-runner / per-instance 边界)、以及护栏清单(writer ratchet、namespace-coverage lint、migration-deferral ratchet)。整个 review 交锋过程本身就是一份"配置模型迁移边界情况清单",比正文更有学习价值。

参与讨论