Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-01 17:58 同步状态:空闲 下次计划:2026-09-01 18:58

PR 列表

更多筛选
2026-08-27

#36485 [diffusion] align video BCG warmup frame count

原始 PR · 作者 BBuf · 合并时间 2026-08-27 20:52

功能 重要性 6.79 洞察度 5.00

新增 --warmup-num-frames,对齐视频 BCG 预热与 serving 帧数

值得短读。重点关注三处设计决策:`_resolve_warmup_num_frames` 中显式覆写与 `MagicMock` 兼容的写法;`_adjust_warmup` 将帧数纳入“显式形状”推断的联动逻辑;`build_sglang_cmd` 中 preset 参数到服务参数的透传模式。这些模式对后续增加更多 warmup 形状配置有参考价值。

功能 重要性 9.00 洞察度 7.00

为负载感知路由器新增 per-scheduler 负载发布 socket

值得精读。这是为外部路由器提供真实负载数据的基础设施 PR,设计质量高:端口推导与广播单一来源、opt-in 保护升级兼容、去重心跳保证迁移及时性、golden bytes 钉跨语言契约。对计划接入 sgl-router cache_aware_zmq 或自研负载感知路由的团队,这是必读的引擎侧对接规范;对一般模型服务团队,只需确认 `--load-publish-endpoint` 默认关闭、升级无影响即可。

#36681 Move server args config parser under utils

原始 PR · 作者 merrymercy · 合并时间 2026-08-27 18:34

重构 重要性 4.77 洞察度 2.00

将配置解析器移入 utils,统一模块组织结构

不建议精读,这是一次低风险、机械的模块整理。值得注意的设计决策是采用“延迟导入”避免循环依赖,并提供了可复现的迁移验证方法,对于类似重构有参考价值。

文档 重要性 4.00 洞察度 4.00

修正 H200 BF16/FP8 低延迟配方的 verify 后端文档

该 PR 值得快速浏览,因为它揭示了文档与后端行为之间的耦合关系。建议关注 Codex 提出的高吞吐量配方未覆盖的问题,可能需要在后续 PR 中为 H200 高吞吐量配方也添加 Triton verify 标志,或修改通用投机处理逻辑以自动处理该情况。

性能优化 重要性 5.58 洞察度 6.00

H100 MoE 新增 TMA 配置,LingBot-Video 推理提速约 2%

值得精读。虽然只是两个 JSON 文件 + 一个测试函数,但它展示了:以真实负载 shape(5034/5049 token)为基准做内核配置调优、用 ABBA 交叉验证和 SHA256 断言保证无数值回归、以及将调优结果固化为可被测试保护的配置资产。对于要在新 Triton 版本或新硬件上做 MoE 性能调优的团队,这是很好的参考样例。

缺陷修复 重要性 7.55 洞察度 6.00

修正权重缓存驻留内存导致 KV 过度分配、启动 OOM

值得精读。重点学习两个设计决策:其一,rank-local 校正必须先于分布式 MIN,因为不同 rank 的权重驻留量不同,MIN 之后再补偿会算错;其二,用“loader 字段默认 0 + no-op 校正”替代显式 daemon 模式判断,使普通启动零开销、未来任何预驻留权重的 loader 都能复用同一钩子。此外,review 中“去掉额外本地快照与第二次 MIN,直接加回已有基线”的演进展示了如何收敛过度防御的实现。若团队后续推广此机制,建议补充 daemon 集成测试与 KV sizing 单测。

#34492 XPU: remove SGLANG_USE_SGL_XPU flag

原始 PR · 作者 Xia-Weiwen · 合并时间 2026-08-27 17:38

重构 重要性 7.04 洞察度 5.00

移除 XPU 开关,默认启用 sgl-kernel MoE,可参数回退

值得精读。关注三个设计决策:一是「环境变量开关 → server args 显式后端」的配置收敛模式,可复用到其他平台的类似开关清理;二是双路径并存的分支写法 `is_xpu() and not get_moe_runner_backend().is_triton()`,在保持默认高性能的同时保留逃生通道;三是参数化测试对后端优先级矩阵的覆盖方式(server 参数优先于 layer 参数),可作同类后端选择测试的参考模板。

参与讨论