移除 prefill CUDA graph 内存门槛,修复默认配置静默性能回退
值得精读。该 PR 展示了一个典型的设计决策反转:用配置驱动取代硬编码安全门槛,并伴随测试策略的同步调整(删除阈值单测、新增低显存行为回归)。阅读时可关注 `capture_prefill_graph` 的守卫顺序与日志信息,并结合 #31204 的实测数据判断默认行为与启动可靠性的平衡是否合理。
SGLang is a high-performance serving framework for large language models and multimodal models.
移除 prefill CUDA graph 内存门槛,修复默认配置静默性能回退
值得精读。该 PR 展示了一个典型的设计决策反转:用配置驱动取代硬编码安全门槛,并伴随测试策略的同步调整(删除阈值单测、新增低显存行为回归)。阅读时可关注 `capture_prefill_graph` 的守卫顺序与日志信息,并结合 #31204 的实测数据判断默认行为与启动可靠性的平衡是否合理。
K3 VLM 传输文档:命令选择器按拓扑显示 Auto 解析
值得 K3 部署用户与文档维护者阅读。重点关注 `mmTransport` 维度的分支逻辑是否与实现侧自动选择保持同步,以及命令选择器缺少单元测试的问题;后续可以有选择地为该 snippet 补充渲染测试。
修复延迟释放队列持有可变视图导致的 KV 错放
值得精读,核心价值不在代码量(+60/-44)而在根因定位与设计决策:把“入队即拥有”的不变量放在 allocator 边界,而不是让每个调用方自证视图安全,从而同时保留批量释放收益与视图安全性。建议关注两点:`_copy_for_free_group` 的约定是否会被后续 hardware backend 复用;是否值得用机制(如注册表检查或 debug 断言)替代人工约定,防止未来 allocator 漏掉拷贝导致静默回归。
统一 WAR 栅栏为共享读边界声明,删除策略枚举
值得精读,尤其是对计划接入新 attention backend 或需要理解 sglang WAR overlap 机制的工程师。重点学习三点设计:SharedReadBoundary 用枚举表达相对 replay 的边界位置、UNKNOWN 作为安全底值的降级策略、以及默认值从 out-graph/in-graph 契约推导而不是从布尔标志拼接。配合两个 CPU 单测的平移方式可快速掌握整个决策矩阵。
修复 piecewise CUDA graph 测试 stub 缺失 hf_config 导致的 CI 失败
值得快速浏览以理解 piecewise CUDA graph 兼容性规则如何读取 `hf_config`,以及测试 stub 需要跟随生产逻辑同步更新。但整体改动直白,无精读必要。
裁剪 24 个冗余 nightly 测试注册,每夜节省约 5.5 GPU 小时
值得 CI owner 与测试维护者精读,其"covered elsewhere / cannot run as registered / guard dead code"的三分法可作为 nightly 测试治理的通用模板。对产品研发而言,需重点关注两处被删测试的替代覆盖:fa_skip_kv_cache piecewise NaN 回归测试与 chunked SGMV LoRA 内核测试;建议在其他可运行套件中补回等价断言,或在对应内核/后端发生变更时主动重建回归测试。整体变更方向正确,但删除回归测试时应在 PR 中明确指向替代覆盖的具体用例文件,便于后续审计。
重构 NPU PR CI 降低并发并快速失败
建议 CI 基础设施维护者精读,重点关注健康检查的根因失败过滤逻辑与 per-case 输出下沉设计,这两处体现了避免级联误杀和保证可观测性之间权衡;普通贡献者只需了解 NPU 套件命名规则即可。注意观察合并后 base-c 套件的实际稳定性,尤其是 GLM5 阈值下调是否有 flaky 依据。
为 NPU 注意力后端与 MLA 预处理新增单元测试
值得快速阅读,不需要精读。重点看两点:`_ref_extend` 参考实现如何用 torch 原生 SDPA 模拟 paged KV 的 extend 语义,这是验证注意力后端正确性的通用范式;`test_npu_mla_preprocess.py` 中环境变量 + `lru_cache` 的测试隔离手法(`patch.dict` + `cache_clear`)。若后续 NPU 后端有 kernel 级重构,此 PR 提供的测试可直接作为回归基线。
参与讨论