Prhub

sglang 2026年第33周(08-10至08-16)周报

本周 sglang 以 Diffusion 模型原生化、缓存与内核基础设施重构、配置系统一致性收口为主线,兼顾多硬件适配与 JIT 构建系统重写,共合并 352 个 PR。

仓库:sgl-project/sglang 周期:2026-08-10 至 2026-08-16 来源 PR:352 · 重点 PR:24 自动生成 · 生成于 2026-08-17 01:01

本周亮点

  • Diffusion 子系统“原生化”进程加速:Hunyuan3D Paint/Delight、Qwen2.5-VL、Qwen3-VL、LongCat-Image 等模型从 HF/Diffusers 迁移为 SGLang 原生实现,Hunyuan3D 去噪单步耗时从约 417ms 降至 77-98ms,Cosmos3 T2I 融合 QKNorm+RoPE 在 B300 上提速 13.4%。
  • 缓存与内存基础设施重构密集:HiCache L2 传输扁平化(#34793)、CUDA VMM 分配统一(#34199)、多模态内容寻址预缓存(#34398)以及 MLX 窗口化 SWA KV(#34166)等,为后续扩展奠定基础。
  • 配置系统一致性重构(config bags)由 ch-wan 主导,本周 10 个 PR 分批将 server_args 直读迁移到 bags,覆盖 17 个消费点,并加入静态 ratchet 测试,降低配置漂移风险。
  • 多硬件支持扩大:NPU 上新增 Kimi-K3 全链路(#33465)和 MiniMax M3 w8a8 适配(#32941),MLX 后端支持 gpt-oss 滑动窗口与图内采样(#30050、#34166),AMD 端完成 NVFP4 转 MXFP4 在线重量化(#29328)。
  • JIT 构建系统重写(#34274)采用内容寻址缓存,warm load 0.02-0.08s,第二个 clone 冷启动从 5.26s 降至 0.05s,开启“key 即文件全文”的依赖追踪范式。
  • 远程媒体 URL 安全加固(#34892)加入域名白名单和下载大小限制,多模态预缓存同时引入严格 SHA-256 身份,强化了输入安全边界。

风险观察

  • 核心路径变更高发(42 次),缓存、调度、加载路径的重构可能导致回归,需加强跨模块回归测试。
  • 测试缺口明显:27 个“缺少测试覆盖”和 5 个“无测试覆盖”,新模型和 NPU/AMD 路径多依赖人工验证,建议补充自动化测试。
  • 配置 bags 重构涉及默认行为变更(显式 / 隐式),虽用静态测试锁定,但运行期语义差异仍需持续观察。
  • 部分 PR 通过维护者权限绕过失败的 CI(如 #34793),合并门禁的威慑力被削弱,需审查 CI 纪律。

完整周报

执行摘要

本周(2026-08-10至08-16)sglang共合并352个PR,其中重点PR 24个,平均重要性6.52。变化主线集中在三个方向:多模态/Diffusion原生化缓存与内核基础设施重构以及配置系统一致性收口。mickqian(41个)和BBuf(33个)贡献了最多代码,diffusion(76)、bugfix(112)、performance(90)是标签热点。同时,NPU、MLX、AMD等多硬件适配步伐加快,JIT构建系统重写带来显著的开发者体验提升。

本周重点变化

  • Diffusion原生模型大批落地。Hunyuan3D Paint/Delight(#34980)迁移为原生SD 2.1兼容实现,去噪单步约4倍提速;Qwen2.5-VL(#34896)和Qwen3-VL(#34945)视觉编码器原生化,并修复H100上的FP32 RoPE精度回归;LTX-2.5(#34471)通过架构确认复用了LTX-2管线,新增时长预测头与扩散解码器。
  • 缓存基础设施重构。HiCache L2传输改为扁平命令执行(#34793),消除递归分发;CUDA VMM分配逻辑统一(#34199)收口四类消费者;多模态侧新增内容寻址预缓存基础设施(#34398),为Kimi-K3 per-image缓存(#34404)提供底层支持。
  • 配置一致性迁移。ch-wan的config bags系列PR(#34263~#34819)分多步将runner侧的server_args直读迁移到bags,覆盖注意力后端决策、动态配置读取等,并以静态ratchet测试锁定暴露面。
  • JIT构建系统重写。内容寻址的ninja构建缓存(#34274)用自生成build.ninja替代正则解析,双key追踪依赖,冷启动从5.26s降至0.05s,并修复多个边角问题。
  • 多硬件适配。NPU上Kimi-K3(#33465)全链路支持,MiniMax M3 w8a8(#32941)打通稀疏注意力和Eagle3投机;MLX后端窗口化SWA KV(#34166)大幅降低内存占用;AMD新增NVFP4在线转MXFP4量化(#29328)。
  • 安全性。远程媒体URL白名单与下载限制(#34892)落地,配合多模态内容哈希缓存,收紧输入边界。

模块与主题趋势

从标签看,bugfix(112)和performance(90)占据主要比重,diffusion(76)紧随其后,说明本周是“修问题+提性能+扩模型”并行的一周。热点文件集中在server_args.py(12次改动)和environ.py(7次),反映配置与环境变量管理是持续演化的焦点;Kimi-K3相关文件出现5次,说明该模型是重点调试对象。主题趋势上,“原生化”是明确方向——模型、编码器、量化后端、JIT构建都在从外部依赖走向自包含实现,配合位精确(bit-exact)验证,试图在不损失数值一致性的前提下获得性能收益。另一个值得注意的主题是配置读取收敛:大量PR通过config bags和静态检查将散落的server_args访问集中管理,降低配置漂移风险。

风险观察

本周风险标签中“核心路径变更”高达42次,其中涉及缓存、调度、注意力后端的重构尤为密集。多个PR在合入时缺少直接测试覆盖(27+5+3),特别是NPU、AMD、MLX等平台路径多依赖手动验证或夜间测试,如#33465的NPU后端无自动化测试,#32941的CUDA路径需回归验证。配置bags重构涉及默认行为变更(如显式/隐式区分),虽然以静态测试锁定,但运行期语义仍需要观察。此外,#34793存在CI失败但作者以维护者身份合并的情况,这种“绕过门禁”的做法可能掩盖回归,值得关注。

重点PR速览

  • #34274 [kernel] Content-addressed JIT build cache:重写JIT构建系统,自生成ninja + 双key缓存,冷启动从5.26s降至0.05s,修复ROCm依赖追踪和TP rank重复构建问题,是基础设施级改进。
  • #34793 refactor(hicache): flatten L2 transfer execution:将HiCache L2传输扁平化为命令列表,消除嵌套分发,职责边界清晰,但CI失败仍被合并,验证数据需复跑。
  • #34471 [diffusion] Support LTX-2.5:通过meta device校验确认架构复用LTX-2.3,新增时长预测头和扩散解码器,支持TP/SP/CFG并行,文档多轮优化后合入。
  • #34404 [VLM] Cache Kimi-K3 per-image processor artifacts:引入模型无关的per-media artifact缓存,Kimi-K3成为首个typed adapter,冷热命中位级一致,为调度器lease复用铺路。
  • #34206 [EPD] Pipeline owner-only multimodal preprocessing:重构EPD图像预处理为owner流水线,Kimi-K3吞吐最高+30%,展示延迟物化抽象。
  • #32017 [Model Loading] Overlap checkpoint staging with CUDA graph capture:启动期权重预取与CUDA graph捕获重叠,通过哨兵权重+存储清单保障正确性,修复了多个review发现的正确性问题。
  • #34166 [MLX] Window-bounded SWA KV storage and in-graph sampling:MLX后端窗口化KV存储减少约47-49%内存,图内采样避免CPU桥接,是MLX后端重要里程碑。

后续建议

  1. 补强测试:针对缺少测试覆盖的新模型和平台路径,尽快补充单元级或注册级测试,尤其是NPU/MLX/AMD路径的自动化回归。
  2. 验证配置迁移:config bags大范围改动后,建议在RC阶段进行完整场景的端到端验证,特别是split加载、投机解码、LoRA等组合路径。
  3. 关注缓存一致性:多个缓存重构(HiCache、preprocess cache、JIT cache)并行进行,需要制定统一的稳定性验证矩阵,防止交叉影响。
  4. 规范CI纪律:明确“CI失败需公开原因并重跑”的规则,避免维护者权限被当作绕过门禁的捷径。
  5. 生态扩展:serve后端插件机制(#34753)落地,可进一步打磨文档和示例,吸引更多外部运行时集成。

参与讨论