#28579 [spec decoding] fully overlap spec decoding for hybrid linear attention backend
原始 PR · 作者 Qiaolin-Yu · 合并时间 2026-06-19 04:31
混合线性注意力后端推测解码完全重叠
建议阅读以了解如何在 CUDA Graph 捕获与 replay 时高效传递 padding 信息。`hybrid_linear_attn_backend.py` 中的 `_replay_metadata` 函数修改展示了如何通过可选的 `num_padding` 参数避免冗余计算,这种模式可推广到其他后端。
参与讨论