Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 23:02 同步状态:空闲 下次计划:2026-09-03 00:02

PR 列表

更多筛选
2026-06-10
测试 重要性 7.60 洞察度 5.00

新增 AST 契约测试防止 bookkeeping 时钟越权修改

此 PR 值得精读,尤其是其使用 AST 静态分析实现契约测试的设计模式,可以推广到其他需要保护关键数据修改点的场景。白名单+计数检查的方式既严格又灵活,值得借鉴。

#27017 fix(schema): update tokens_after_end

原始 PR · 作者 Muqi1029 · 合并时间 2026-06-10 07:52

缺陷修复 重要性 4.38 洞察度 3.00

修复 schema 缓存导致的 reasoning 状态残留 bug

值得合入,修复逻辑清晰。建议后续为 `reasoner_grammar_backend` 添加单元测试覆盖 cached schema 场景,防止回归。

#27453 Remove FlashInfer GB transport workaround

原始 PR · 作者 mmangkad · 合并时间 2026-06-10 07:48

重构 重要性 7.00 洞察度 4.00

移除 GB200/GB300 FlashInfer 传输工作区

该 PR 是典型的临时工作区移除操作,逻辑清晰、测试充分(本地验证)。对于关注 NVIDIA GB 系列平台或 FlashInfer 集成细节的开发者,值得阅读关键源码片段以了解传输通道选择逻辑。建议快速合并。

缺陷修复 重要性 5.29 洞察度 3.00

修复 Gemma4 多模态处理器 token_regex 缺失导致的 prompt 解析错误

该 PR 修复逻辑清晰、代码简洁,值得阅读以理解多模态 token 扩展的处理模式。其设计决策——通过正则表达式的备选分支同时支持新旧格式——是保持向后兼容的通用方法。不过如果时间有限,可直接参考 gemma3.py 中已生效的相同模式,本 PR 仅是对齐遗漏。

#27660 [AMD] Update amd qwen3.5 cookbook

原始 PR · 作者 1am9trash · 合并时间 2026-06-10 07:26

documentation 重要性 4.95 洞察度 2.00

更新 AMD Qwen3.5 部署文档与交互式片段

本 PR 属于常规文档更新,值得 AMD 用户关注。建议审阅时确认: - Docker 镜像标签是否与当前发布版本一致; - `sglang serve` 与 `python3 -m sglang.launch_server` 的选择是否与项目标准一致。

#27721 Add TP server GPU process regression test

原始 PR · 作者 merrymercy · 合并时间 2026-06-10 07:25

测试 重要性 7.60 洞察度 5.00

新增 TP 服务进程 GPU 上下文回归测试

建议精读此测试的实现思路,特别是 `_wait_for_server_gpu_processes` 中的稳定等待策略以及如何利用进程树过滤 GPU 进程;该模式可用于其他与 GPU 资源分配相关的回归测试。

#26049 Fix GLM NextN draft value head dim

原始 PR · 作者 yueming-yuan · 合并时间 2026-06-10 07:13

缺陷修复 重要性 6.29 洞察度 6.00

修复 GLM NextN draft 的 v_head_dim 推导

值得精读。虽然改动了 11 行,但其背后的 root cause 揭示了 MHA/MLA 混合架构下的 `v_head_dim` 继承陷阱。核心设计要点是:当模型配置源自 MLA 架构时,`v_head_dim` 可能远大于 MHA draft 的真实 `head_dim`,必须在架构重写时显式修正。此模式可作为未来类似 MHA-over-MLA draft adapter 的参考。

#27468 dflash piecewise cuda graphs support

原始 PR · 作者 dcw02 · 合并时间 2026-06-10 06:44

功能 重要性 6.49 洞察度 5.00

DFLASH 推测解码支持分段 CUDA 图

建议合并。该 PR 代码简洁,改动量小(+55/-4),有明确的动机和测试覆盖。值得关注的设计决策是在初始化阶段提前决定 capture_hidden_mode,而不是在运行时动态判断,保证了 capture 和 replay 的一致性。

参与讨论