Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-03 23:33 同步状态:空闲 下次计划:2026-09-04 00:33

PR 列表

更多筛选
2026-08-06

FLUX.2 VAE 快速路径泛化至 AutoencoderKL,quality=high 解码提速 2.4x

值得精读。该 PR 示范了一种高性价比的泛化模式:把一次性的特定模型优化抽取为“共享安装体 + 类型守卫入口”,并用请求级 gate 将位精确路径与快速路径隔离。关注点应放在 `_install_decoder_fast_paths` 的 fail-closed 检查链和 `VaeFastPathGate` 的设计,以及 PR body 中 decode 级显式同步的 benchmark 协议(这是评估 VAE 优化的可靠方法)。若团队后续要支持更多 diffusers 系 VAE,此模式可直接复制。

缺陷修复 重要性 7.04 洞察度 5.00

SWA 逃生舱仅限真活锁,消除 transient 压力下的 retraction 风暴

值得精读。该 PR 是一个教科书式的“逃生舱过度触发”修复:用最小改动(新增一个判定函数 + 两处门控)恢复设计意图,并以三场景表格清晰论证边界,是调度策略类 bugfix 的典范。关注点:`_swa_req_never_fits()` 复用 `_swa_budget_for_req` 与 `_swa_chunk_cap` 的预算口径,保持了单一数据源;测试用 `SimpleNamespace` 模拟 `tree_cache` 与 `token_to_kv_pool_allocator`,验证了纯逻辑可测性。建议后续补充边界(等于 `size_swa`)与真实 allocator 的集成测试。

#33845 [diffusion] centralize entrypoint API hygiene

原始 PR · 作者 mickqian · 合并时间 2026-08-06 21:53

重构 重要性 7.59 洞察度 4.00

集中扩散入口 API 卫生与共享游标分页

值得精读,重点看 stores.py 中 AsyncDictStore.list_page 与 common_api.py 中 _build_model_card 的集中化方式,可作为入口 API 卫生重构的参考样例。建议后续补充针对 list_page 游标语义与非法 order 兜底的单元测试,以覆盖本次重构的关键行为。

#33843 [diffusion] consolidate pipeline core hygiene

原始 PR · 作者 mickqian · 合并时间 2026-08-06 21:51

重构 重要性 8.01 洞察度 4.00

集中扩散 pipeline core 重复逻辑,清理未用 logger 与冗余字段

值得精读。它展示了大型代码库中“去重 + 集中公共逻辑”的安全重构路径:先抽出共享函数(`calculate_linear_shift`),再逐个删除本地副本,最后处理字段声明与 import。重点关注两点:一是 `denoising_dmd.py` 删除本地覆盖后如何保证与共享基类行为一致;二是 `ServerArgs` 字段合并时对 dataclass 序列化顺序的刻意保护。若后续接手扩散模块,建议先确认 Extra CI 失败原因,并考虑为 `calculate_linear_shift` 补充单元测试。

重构 重要性 7.98 洞察度 4.00

简化扩散解耦传输层,清理过期同步 API 与重复 schema

值得快速翻阅,不必精读:作为 refactor-only 清理,它展示了在活跃子系统中收敛 schema、删除 dead API、复用已有工具函数的实践。重点看 `manager.py` 中同步/异步 API 的去留判断、`protocol.py` 中 `TransferStagedMsg` 的 schema 化,以及 `_prefetch_transfer_ready` 返回元组的收窄方式。若要在生产长期维护,建议补一个覆盖 async stage/load 的轻量单测,并说明 extra CI 失败的原因。

缺陷修复 重要性 6.27 洞察度 4.00

按模型能力门控 CUDA IPC,纯文本模型退回 CPU

值得精读。PR 展示了如何在 server args 解析阶段利用 model_config.is_multimodal 做能力门控,以及如何用测试固定自动策略的“默认契约”。实现虽小,但对理解 sglang 多模态特征传输的自动解析路径有帮助,测试写法也有参考价值。

#32999 [diffusion] Fix GLM-Image resolution alignment

原始 PR · 作者 AuFlow · 合并时间 2026-08-06 20:41

缺陷修复 重要性 8.63 洞察度 5.00

修复 GLM-Image 非对齐分辨率统一向上取整到 32 倍数并新增 resize 字段

值得精读。该 PR 展示了一个跨阶段一致性 bug 的系统性修复思路:把对齐逻辑收敛到单一工具函数,在入口处提前归一化并增加校验防线,同时通过响应字段向用户透明化行为变更。关注点包括 `glmimage.py` 的对齐实现、AR 阶段的校验、以及 `_get_response_resize` 对真实尺寸的读取回退逻辑。

性能优化 重要性 8.49 洞察度 7.00

ERNIE-Image 融合 RMSNorm+scale/shift 为 bit-exact Triton 内核,e2e 提速 4%

值得精读。核心亮点:① 如何通过复现浮点运算顺序(有序 fadd、禁用 FMA 收缩、inline PTX 复现 rsqrt.approx)实现 bit-exact 的 kernel fusion;② 运行时自校验 + 一次性 fallback 的稳健设计模式;③ 与 #33734 的递进关系,展示了如何把被否决的有损融合重新做成无损默认路径。对需要做 kernel fusion 且要求输出不变的场景有很强的借鉴意义。

参与讨论