打包视觉塔 + 并发预处理 + CUDA 图,OCR 吞吐近 2 倍
值得精读。设计层面有四个可复用点:宿主端边界避免 device-to-host 同步、LFU 位置编码缓存、kernel==stride 时 conv 到 matmul 的算子降级、多模态架构在 CUDA graph allowlist 上的回归。流程层面,作者对 worker 数和 vLLM 对比数字的两次自我纠偏,以及把“逐位精确”与“GEMM 容差”分开断言的测试哲学,是高质量性能工程的范本。建议后续在引入低精度或新后端时重点回归数值一致性。
参与讨论