Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-08

#33352 fix: always capture default prefill CUDA graph

原始 PR · 作者 mickqian · 合并时间 2026-08-08 19:24

缺陷修复 重要性 7.02 洞察度 5.00

移除 prefill CUDA graph 内存门槛,修复默认配置静默性能回退

值得精读。该 PR 展示了一个典型的设计决策反转:用配置驱动取代硬编码安全门槛,并伴随测试策略的同步调整(删除阈值单测、新增低显存行为回归)。阅读时可关注 `capture_prefill_graph` 的守卫顺序与日志信息,并结合 #31204 的实测数据判断默认行为与启动可靠性的平衡是否合理。

#34099 docs: clarify K3 VLM feature transport

原始 PR · 作者 mickqian · 合并时间 2026-08-08 19:23

文档 重要性 5.17 洞察度 3.00

K3 VLM 传输文档:命令选择器按拓扑显示 Auto 解析

值得 K3 部署用户与文档维护者阅读。重点关注 `mmTransport` 维度的分支逻辑是否与实现侧自动选择保持同步,以及命令选择器缺少单元测试的问题;后续可以有选择地为该 snippet 补充渲染测试。

#34067 [Bugfix] Fix batched KV free aliasing

原始 PR · 作者 YazhiGao · 合并时间 2026-08-08 18:34

缺陷修复 重要性 7.17 洞察度 5.00

修复延迟释放队列持有可变视图导致的 KV 错放

值得精读,核心价值不在代码量(+60/-44)而在根因定位与设计决策:把“入队即拥有”的不变量放在 allocator 边界,而不是让每个调用方自证视图安全,从而同时保留批量释放收益与视图安全性。建议关注两点:`_copy_for_free_group` 的约定是否会被后续 hardware backend 复用;是否值得用机制(如注册表检查或 debug 断言)替代人工约定,防止未来 allocator 漏掉拷贝导致静默回归。

重构 重要性 8.37 洞察度 6.00

统一 WAR 栅栏为共享读边界声明,删除策略枚举

值得精读,尤其是对计划接入新 attention backend 或需要理解 sglang WAR overlap 机制的工程师。重点学习三点设计:SharedReadBoundary 用枚举表达相对 replay 的边界位置、UNKNOWN 作为安全底值的降级策略、以及默认值从 out-graph/in-graph 契约推导而不是从布尔标志拼接。配合两个 CPU 单测的平移方式可快速掌握整个决策矩阵。

缺陷修复 重要性 3.71 洞察度 3.00

修复 piecewise CUDA graph 测试 stub 缺失 hf_config 导致的 CI 失败

值得快速浏览以理解 piecewise CUDA graph 兼容性规则如何读取 `hf_config`,以及测试 stub 需要跟随生产逻辑同步更新。但整体改动直白,无精读必要。

基础设施 重要性 7.71 洞察度 3.00

裁剪 24 个冗余 nightly 测试注册,每夜节省约 5.5 GPU 小时

值得 CI owner 与测试维护者精读,其"covered elsewhere / cannot run as registered / guard dead code"的三分法可作为 nightly 测试治理的通用模板。对产品研发而言,需重点关注两处被删测试的替代覆盖:fa_skip_kv_cache piecewise NaN 回归测试与 chunked SGMV LoRA 内核测试;建议在其他可运行套件中补回等价断言,或在对应内核/后端发生变更时主动重建回归测试。整体变更方向正确,但删除回归测试时应在 PR 中明确指向替代覆盖的具体用例文件,便于后续审计。

基础设施 重要性 7.51 洞察度 5.00

重构 NPU PR CI 降低并发并快速失败

建议 CI 基础设施维护者精读,重点关注健康检查的根因失败过滤逻辑与 per-case 输出下沉设计,这两处体现了避免级联误杀和保证可观测性之间权衡;普通贡献者只需了解 NPU 套件命名规则即可。注意观察合并后 base-c 套件的实际稳定性,尤其是 GLM5 阈值下调是否有 flaky 依据。

测试 重要性 7.57 洞察度 4.00

为 NPU 注意力后端与 MLA 预处理新增单元测试

值得快速阅读,不需要精读。重点看两点:`_ref_extend` 参考实现如何用 torch 原生 SDPA 模拟 paged KV 的 extend 语义,这是验证注意力后端正确性的通用范式;`test_npu_mla_preprocess.py` 中环境变量 + `lru_cache` 的测试隔离手法(`patch.dict` + `cache_clear`)。若后续 NPU 后端有 kernel 级重构,此 PR 提供的测试可直接作为回归基线。

参与讨论