#38995 [Quantization] - Layerwise reloading of Attention/KV quantized models
原始 PR · 作者 Josephasafg · 合并时间 2026-04-16 09:03
实现量化模型中注意力缩放权重的层间重载,修复标量权重计数问题。
该PR值得精读,特别是`layerwise.py`中的`_finalize_attention_layer`和`_reload_attention_scales`函数,展示了如何处理注意力层的独特重载逻辑和设计中的顺序权衡。关注点包括:设备放置逻辑的潜在问题、注意力层与线性层的处理顺序依赖,以及标量权重加载修复对计数机制的影響。
参与讨论