重构
重要性 9.08
洞察度 6.00
Qwen3-VL 视觉编码器去掉 Transformers 依赖,改为原生实现
值得精读。该 PR 展示了将 Transformers 模型组件替换为 SGLang 原生实现时需要注意的多个约束:checkpoint 参数名兼容、FP32 位置插值、计算布局对齐,以及 layerwise offload/FSDP 分片的接入方式。同时有明确的数值对拍方法和分层 offload 测试,可作为后续视觉编码器原生化的参考。