Prhub

sgl-project/sglang

SGLang is a high-performance serving framework for large language models and multimodal models.

监控状态:已开启 最近同步:2026-09-02 20:51 同步状态:空闲 下次计划:2026-09-02 21:51

PR 列表

更多筛选
2026-08-16

#34870 Fix swa eviction frontier for bigram keys

原始 PR · 作者 ispobock · 合并时间 2026-08-16 11:52

缺陷修复 重要性 6.69 洞察度 5.00

修复 EAGLE bigram key 下 SWA 驱逐边界偏移导致的池泄漏

值得精读。这是一个典型的 '同一长度在两个坐标系下差一' 的根因修复:raw token 数与 bigram key 长度错一页,级联触发驱逐边界偏高、match 拒绝、保护长度停滞、KV 误释放。修复方式克制——提前构造 `RadixKey`、以 `len(radix_key) - 1` 作为唯一度量,并明确 'raw path 不动'。建议重点阅读 `cache_unfinished_req` 中 key 构造时机调整,以及 `TestSWAWindowUnderBigramKey` 对页对齐形态的构造(`seq_len = 4 * page_size`),这是复现该 bug 的最小形态。

#34736 [Diffusion] Unify component residency controls

原始 PR · 作者 mickqian · 合并时间 2026-08-16 11:24

功能 重要性 9.18 洞察度 7.00

新增 --component-residency 统一组件驻留控制,重构 offload 策略矩阵

该 PR 值得精读,尤其是 `component_residency.py` 的解析与 `server_args.py` 的 `explicit_residency_mode` 折算逻辑,是配置兼容性设计的良好范例。关注点建议放在:canonical 与 legacy 混用时的边界行为、`start_at_stage_entry` 对缓存命中路径的性能影响、以及动态组件替换后的清理策略。对于集成方,若有自定义 stage,必须实现 `component_uses` 与 `use_declared_component` 契约,否则默认 resident 行为可能不符合预期。

缺陷修复 重要性 5.86 洞察度 5.00

gfx95x fp8 量化改用设备真实上限 448,修复静默精度损失

值得快速精读:这是一个小而典型的“设备相关常量硬编码”bug 修复,教科书式展示了用模块级解析常量替代魔法数字,并用非 mock 的真实内核回归测试在目标硬件上钉住行为。对关注 ROCm 量化精度、硬件差异处理或硬件门控测试策略的工程师有参考价值;且已获 AMD 维护者批准合并。

功能 重要性 6.43 洞察度 5.00

gfx950 启用密集 MHA 预填充回退,TTFT 降 22%-43%

值得精读,尤其是 FP8 KV 缓存布局差异(原始 vs 缩放布局)和 chunked-prefill 拆分时 KV refetch 导致 stale 数据的问题,这对 AMD 平台上的 MLA 注意力实现有借鉴意义。建议关注后续对 `get_mla_kv_buffer` 的改动,以及是否有补充 gfx950 路径测试的计划。

重构 重要性 9.00 洞察度 6.00

H3 VAE 注意力统一走原生 USP 后端,删除本地 SDPA 包装

值得精读:`attention.py` 展示了如何将封闭的 VAE bundle 接入组件化后端选择并保持精度契约;`audio_vae.py` 的 dtype 处理(显式 fused 才 cast)是值得参考的精度策略;`layer.py` 的 `skip_sequence_parallel` 与 ring 准入解耦值得关注。建议在合入后跟踪 ROCm gfx95 与 MPS 路径的回归测试结果,并确认与 #34891 的注意力后端选择改动协调一致。

功能 重要性 9.18 洞察度 6.00

Hunyuan3D Paint/Delight 迁移为 SGLang 原生模型,提速约 4 倍

值得精读。重点看三处设计:一是 `Hunyuan3DPaintTransformerBlock` 的 reference 特征缓存与 mode 机制;二是 `StableDiffusionUNetConfig.validate` 的严格数据契约;三是 paint 阶段如何通过 `use_declared_component` 把模型加载让渡给组件管理器。若团队计划迁移其他 diffusion 模型,此 PR 是 diffusers 解除依赖的教科书式案例。

#34951 [Diffusion] Native ERNIE prompt enhancer

原始 PR · 作者 mickqian · 合并时间 2026-08-16 09:59

功能 重要性 9.00 洞察度 6.00

ERNIE PE 原生化,支持分层 offload

值得精读。核心看点有两个:一是 sdpa.py 的 cached decode mask 语义修正,这是任何用 PyTorch SDPA 做增量解码时容易踩坑的通用正确性问题;二是 `Ministral3ForCausalLM` 的 offload 契约与 tied weights 处理,可作为扩散原生模型迁移的样板。维护其他 diffusion 模型的工程师建议核对 sdpa.py 变更对其解码数值的影响,并确认现有契约测试覆盖。

#34945 [Diffusion] Native Qwen3-VL vision encoder

原始 PR · 作者 mickqian · 合并时间 2026-08-16 09:58

重构 重要性 9.08 洞察度 6.00

Qwen3-VL 视觉编码器去掉 Transformers 依赖,改为原生实现

值得精读。该 PR 展示了将 Transformers 模型组件替换为 SGLang 原生实现时需要注意的多个约束:checkpoint 参数名兼容、FP32 位置插值、计算布局对齐,以及 layerwise offload/FSDP 分片的接入方式。同时有明确的数值对拍方法和分层 offload 测试,可作为后续视觉编码器原生化的参考。

参与讨论