新增 --warmup-num-frames,对齐视频 BCG 预热与 serving 帧数
值得短读。重点关注三处设计决策:`_resolve_warmup_num_frames` 中显式覆写与 `MagicMock` 兼容的写法;`_adjust_warmup` 将帧数纳入“显式形状”推断的联动逻辑;`build_sglang_cmd` 中 preset 参数到服务参数的透传模式。这些模式对后续增加更多 warmup 形状配置有参考价值。
SGLang is a high-performance serving framework for large language models and multimodal models.
新增 --warmup-num-frames,对齐视频 BCG 预热与 serving 帧数
值得短读。重点关注三处设计决策:`_resolve_warmup_num_frames` 中显式覆写与 `MagicMock` 兼容的写法;`_adjust_warmup` 将帧数纳入“显式形状”推断的联动逻辑;`build_sglang_cmd` 中 preset 参数到服务参数的透传模式。这些模式对后续增加更多 warmup 形状配置有参考价值。
修复 NPU decode 分配器在空闲页池紧张时的越界 gather
值得快速阅读,理解 NPU 分配器的边界条件处理。建议后续补充针对该边界情况的单元测试,以巩固修复效果。
原始 PR · 作者 ShangmingCai · 合并时间 2026-08-27 19:33
为负载感知路由器新增 per-scheduler 负载发布 socket
值得精读。这是为外部路由器提供真实负载数据的基础设施 PR,设计质量高:端口推导与广播单一来源、opt-in 保护升级兼容、去重心跳保证迁移及时性、golden bytes 钉跨语言契约。对计划接入 sgl-router cache_aware_zmq 或自研负载感知路由的团队,这是必读的引擎侧对接规范;对一般模型服务团队,只需确认 `--load-publish-endpoint` 默认关闭、升级无影响即可。
原始 PR · 作者 merrymercy · 合并时间 2026-08-27 18:34
将配置解析器移入 utils,统一模块组织结构
不建议精读,这是一次低风险、机械的模块整理。值得注意的设计决策是采用“延迟导入”避免循环依赖,并提供了可复现的迁移验证方法,对于类似重构有参考价值。
原始 PR · 作者 huangzhilin-hzl · 合并时间 2026-08-27 17:49
修正 H200 BF16/FP8 低延迟配方的 verify 后端文档
该 PR 值得快速浏览,因为它揭示了文档与后端行为之间的耦合关系。建议关注 Codex 提出的高吞吐量配方未覆盖的问题,可能需要在后续 PR 中为 H200 高吞吐量配方也添加 Triton verify 标志,或修改通用投机处理逻辑以自动处理该情况。
H100 MoE 新增 TMA 配置,LingBot-Video 推理提速约 2%
值得精读。虽然只是两个 JSON 文件 + 一个测试函数,但它展示了:以真实负载 shape(5034/5049 token)为基准做内核配置调优、用 ABBA 交叉验证和 SHA256 断言保证无数值回归、以及将调优结果固化为可被测试保护的配置资产。对于要在新 Triton 版本或新硬件上做 MoE 性能调优的团队,这是很好的参考样例。
原始 PR · 作者 galletas1712 · 合并时间 2026-08-27 17:43
修正权重缓存驻留内存导致 KV 过度分配、启动 OOM
值得精读。重点学习两个设计决策:其一,rank-local 校正必须先于分布式 MIN,因为不同 rank 的权重驻留量不同,MIN 之后再补偿会算错;其二,用“loader 字段默认 0 + no-op 校正”替代显式 daemon 模式判断,使普通启动零开销、未来任何预驻留权重的 loader 都能复用同一钩子。此外,review 中“去掉额外本地快照与第二次 MIN,直接加回已有基线”的演进展示了如何收敛过度防御的实现。若团队后续推广此机制,建议补充 daemon 集成测试与 KV sizing 单测。
原始 PR · 作者 Xia-Weiwen · 合并时间 2026-08-27 17:38
移除 XPU 开关,默认启用 sgl-kernel MoE,可参数回退
值得精读。关注三个设计决策:一是「环境变量开关 → server args 显式后端」的配置收敛模式,可复用到其他平台的类似开关清理;二是双路径并存的分支写法 `is_xpu() and not get_moe_runner_backend().is_triton()`,在保持默认高性能的同时保留逃生通道;三是参数化测试对后端优先级矩阵的覆盖方式(server 参数优先于 layer 参数),可作同类后端选择测试的参考模板。
参与讨论