功能
重要性 9.18
洞察度 7.00
Transformers 后端支持 MLA 注意力与压缩 KV 缓存
值得精读。这是 Transformers 后端 fuser 机制的高级示例,三个设计点尤其值得学习:① 不依赖属性名的纯结构发现(fx 图 + 宽度签名 + 排除法),对上游实现变动有强韧性;② 接口级 KV 展开旁路(vllm_mla 三参数接口),把性能收益建立在接口契约而非内部改写上;③ 融合失败时的告警 + 回退策略(padded 全注意力 + VLLM_MLA_DISABLE),保证了可用性底线。对计划扩展 Transformers 后端支持新注意力结构的开发者有直接借鉴价值。