执行摘要
本周(2026-08-10至08-16)sglang共合并352个PR,其中重点PR 24个,平均重要性6.52。变化主线集中在三个方向:多模态/Diffusion原生化、缓存与内核基础设施重构以及配置系统一致性收口。mickqian(41个)和BBuf(33个)贡献了最多代码,diffusion(76)、bugfix(112)、performance(90)是标签热点。同时,NPU、MLX、AMD等多硬件适配步伐加快,JIT构建系统重写带来显著的开发者体验提升。
本周重点变化
- Diffusion原生模型大批落地。Hunyuan3D Paint/Delight(#34980)迁移为原生SD 2.1兼容实现,去噪单步约4倍提速;Qwen2.5-VL(#34896)和Qwen3-VL(#34945)视觉编码器原生化,并修复H100上的FP32 RoPE精度回归;LTX-2.5(#34471)通过架构确认复用了LTX-2管线,新增时长预测头与扩散解码器。
- 缓存基础设施重构。HiCache L2传输改为扁平命令执行(#34793),消除递归分发;CUDA VMM分配逻辑统一(#34199)收口四类消费者;多模态侧新增内容寻址预缓存基础设施(#34398),为Kimi-K3 per-image缓存(#34404)提供底层支持。
- 配置一致性迁移。ch-wan的config bags系列PR(#34263~#34819)分多步将runner侧的server_args直读迁移到bags,覆盖注意力后端决策、动态配置读取等,并以静态ratchet测试锁定暴露面。
- JIT构建系统重写。内容寻址的ninja构建缓存(#34274)用自生成build.ninja替代正则解析,双key追踪依赖,冷启动从5.26s降至0.05s,并修复多个边角问题。
- 多硬件适配。NPU上Kimi-K3(#33465)全链路支持,MiniMax M3 w8a8(#32941)打通稀疏注意力和Eagle3投机;MLX后端窗口化SWA KV(#34166)大幅降低内存占用;AMD新增NVFP4在线转MXFP4量化(#29328)。
- 安全性。远程媒体URL白名单与下载限制(#34892)落地,配合多模态内容哈希缓存,收紧输入边界。
模块与主题趋势
从标签看,bugfix(112)和performance(90)占据主要比重,diffusion(76)紧随其后,说明本周是“修问题+提性能+扩模型”并行的一周。热点文件集中在server_args.py(12次改动)和environ.py(7次),反映配置与环境变量管理是持续演化的焦点;Kimi-K3相关文件出现5次,说明该模型是重点调试对象。主题趋势上,“原生化”是明确方向——模型、编码器、量化后端、JIT构建都在从外部依赖走向自包含实现,配合位精确(bit-exact)验证,试图在不损失数值一致性的前提下获得性能收益。另一个值得注意的主题是配置读取收敛:大量PR通过config bags和静态检查将散落的server_args访问集中管理,降低配置漂移风险。
风险观察
本周风险标签中“核心路径变更”高达42次,其中涉及缓存、调度、注意力后端的重构尤为密集。多个PR在合入时缺少直接测试覆盖(27+5+3),特别是NPU、AMD、MLX等平台路径多依赖手动验证或夜间测试,如#33465的NPU后端无自动化测试,#32941的CUDA路径需回归验证。配置bags重构涉及默认行为变更(如显式/隐式区分),虽然以静态测试锁定,但运行期语义仍需要观察。此外,#34793存在CI失败但作者以维护者身份合并的情况,这种“绕过门禁”的做法可能掩盖回归,值得关注。
重点PR速览
- #34274 [kernel] Content-addressed JIT build cache:重写JIT构建系统,自生成ninja + 双key缓存,冷启动从5.26s降至0.05s,修复ROCm依赖追踪和TP rank重复构建问题,是基础设施级改进。
- #34793 refactor(hicache): flatten L2 transfer execution:将HiCache L2传输扁平化为命令列表,消除嵌套分发,职责边界清晰,但CI失败仍被合并,验证数据需复跑。
- #34471 [diffusion] Support LTX-2.5:通过meta device校验确认架构复用LTX-2.3,新增时长预测头和扩散解码器,支持TP/SP/CFG并行,文档多轮优化后合入。
- #34404 [VLM] Cache Kimi-K3 per-image processor artifacts:引入模型无关的per-media artifact缓存,Kimi-K3成为首个typed adapter,冷热命中位级一致,为调度器lease复用铺路。
- #34206 [EPD] Pipeline owner-only multimodal preprocessing:重构EPD图像预处理为owner流水线,Kimi-K3吞吐最高+30%,展示延迟物化抽象。
- #32017 [Model Loading] Overlap checkpoint staging with CUDA graph capture:启动期权重预取与CUDA graph捕获重叠,通过哨兵权重+存储清单保障正确性,修复了多个review发现的正确性问题。
- #34166 [MLX] Window-bounded SWA KV storage and in-graph sampling:MLX后端窗口化KV存储减少约47-49%内存,图内采样避免CPU桥接,是MLX后端重要里程碑。
后续建议
- 补强测试:针对缺少测试覆盖的新模型和平台路径,尽快补充单元级或注册级测试,尤其是NPU/MLX/AMD路径的自动化回归。
- 验证配置迁移:config bags大范围改动后,建议在RC阶段进行完整场景的端到端验证,特别是split加载、投机解码、LoRA等组合路径。
- 关注缓存一致性:多个缓存重构(HiCache、preprocess cache、JIT cache)并行进行,需要制定统一的稳定性验证矩阵,防止交叉影响。
- 规范CI纪律:明确“CI失败需公开原因并重跑”的规则,避免维护者权限被当作绕过门禁的捷径。
- 生态扩展:serve后端插件机制(#34753)落地,可进一步打磨文档和示例,吸引更多外部运行时集成。
参与讨论