Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 19:48 同步状态:空闲 下次计划:2026-09-02 20:48

PR 列表

更多筛选
2026-08-06
测试 重要性 7.62 洞察度 5.00

合并 tokenizer 测试、删冗余 e2e,H100 CI 减时约 13 分钟

值得精读 PR body 的覆盖等价性论证与 test_int8_linear_methods.py 的实现模式:真实层 + weight_loader_v2 + 手写 dequant oracle,这种"e2e 冗余 → 层 UT 下沉"的方法对后续量化/后端测试设计有借鉴价值。建议关注合并后 base-b/base-c 套件的稳定性,并考虑为 triton/flashinfer 的端到端精度阈值补充轻量替代或文档说明。

缺陷修复 重要性 7.45 洞察度 5.00

DCP 下 draft KV 池页粒度对齐分配器,修复越界写

值得精读。它展示了分布式推理中 replicated pool 与 shared allocator 之间页粒度对齐的关键细节,以及如何用属性访问器把分散的条件逻辑收敛为单一事实源。关注 loc_space_scale / pool_page_size 的语义,可以避免再次引入同类 bug。

重构 重要性 7.20 洞察度 6.00

补全统一树核心接口边界,行为保持不变的接口重构

值得精读,但重点不在实现逻辑(逻辑非常直接),而在理解 SGLang 统一缓存 TreeCore 拆分的演进路径。建议关注三点:接口方法的选择(为何将 Mamba 特有行为泛化)、PR 有意排除 Rust 后端的边界处理,以及文档中 resumable insert 流程的表述更新方式。对于想参与后续 tree-core 后端工作的开发者,这是必读的契约文档。

#33595 Measure prefill busy time between launches

原始 PR · 作者 cctry · 合并时间 2026-08-06 02:26

重构 重要性 6.01 洞察度 4.00

改为 launch 间隔统计 prefill/decode 忙时,统一负载指标

值得精读,虽然改动量不大,但它是调度器负载统计口径的一次重要统一设计。可以重点关注 `_record_step_counters` 中样本过滤条件的组合,以及 `after_idle_gap` 标记在重叠事件循环中的传递路径。建议后续补充针对边界条件的单元测试,以保护该统计逻辑的稳定性。

功能 重要性 7.73 洞察度 6.00

H3 新增 SageAttention packed varlen 路径并解锁后端,提速约 5-7%

值得精读。重点关注 _sage_packed 的双路径设计:如何用 dense kernel 模拟 varlen、如何用 _trailing_padding_used_len 识别 H3 特定打包布局、以及 padding 置零的技巧。对后续在 diffusion runtime 中接入其他 attention 后端有直接参考价值。

2026-08-05

#33556 Add Ling-3.0-flash cookbook

原始 PR · 作者 JustinTong0323 · 合并时间 2026-08-05 22:53

文档 重要性 7.87 洞察度 4.00

新增 Ling-3.0-flash Cookbook 页面及多硬件配方,并重构 HiCache 控件

值得关注 _playground.jsx 中 HiCache 轴的状态继承设计(deriveFromBase + hasOverride),它解决 cookbook 中已验证配方与用户自定义之间的冲突;ling-3.0-flash.jsx 的 cells 矩阵是模型部署配置的典型样例,可作为新模型接入 Cookbook 的模板。由于不涉及引擎代码,引擎开发者可跳过。

#28267 [NPU] Add causal conv1d

原始 PR · 作者 zhaozx-cn · 合并时间 2026-08-05 22:22

性能优化 重要性 7.12 洞察度 5.00

NPU GDN 后端改用原生 causal_conv1d 算子,TTFT 降低 16%

值得精读,尤其是 `_get_conv_weights_t` 的缓存设计和 `run_mode` 区分 decode/prefill 的接入方式。对要维护 NPU 后端的同学,建议关注三点:一是权重缓存与权重重载的失效机制;二是 `activation_mode` 硬编码是否应改为从 `layer.activation` 映射;三是补齐针对 conv states 更新的单测。整体是一份高质量的单文件 kernel 替换 PR,设计收敛、性能收益明确。

性能优化 重要性 9.00 洞察度 6.00

Wan VAE 融合 kernel 置于 quality 门控,e2e 提速 5.1%

值得精读。核心看点:(1) 在『默认必须逐位一致』的硬约束下推进 kernel 融合的模式——quality 分层 + per-VAE 门控 + fail-closed 安装 + None 回退契约,是一套可复用的模板;(2) FQN 保持的 wrapper 设计(参数直接注册而非嵌套子模块),对任何『偷换模块』式优化都适用;(3) 与 torch.compile 的共存策略(is_compiling 让位 Inductor)。建议重点阅读 wan_vae_cuda_opt.py 的安装校验逻辑与 wan_rmsnorm_silu.py 的 dtype 边界处理。

参与讨论