Prhub

sgl-project/sglang · 标签视图

标签列表

聚合结果

multi-modal 相关 PR

2026-08-16

#34945 [Diffusion] Native Qwen3-VL vision encoder

原始 PR · 作者 mickqian · 合并时间 2026-08-16 09:58

重构 重要性 9.08 洞察度 6.00

Qwen3-VL 视觉编码器去掉 Transformers 依赖,改为原生实现

值得精读。该 PR 展示了将 Transformers 模型组件替换为 SGLang 原生实现时需要注意的多个约束:checkpoint 参数名兼容、FP32 位置插值、计算布局对齐,以及 layerwise offload/FSDP 分片的接入方式。同时有明确的数值对拍方法和分层 offload 测试,可作为后续视觉编码器原生化的参考。