模型执行路径再消除多组 GPU-CPU 同步
值得精读。这是 vLLM 官方维护者在 GPU 同步消除主线上的第二批落地,展示了一类可复用的性能优化范式:用主机侧已有精确数据推导设备端元数据、用 async 拷贝与 fill_ 消除隐式同步、用 keep_on_cpu 避免无意义 staging。建议重点阅读 `vllm/v1/attention/backends/mamba_attn.py` 的 `_prefill_cpu_metadata` 抽取与 `mamba2_attn.py` 的推导替换、`gemma4_mm.py` 的 per-device 索引缓存模式、`diffusion_gemma.py` 的 `init_canvas` 契约收紧。若你维护多模态模型或自定义 attention backend,需要对照检查自己的 `MultiModalFieldConfig` 与元数据构建是否也存在同类同步。
参与讨论