融合 LTX-2.5 decoder 3D RoPE,单 kernel 旋转 Q/K 并缓存表格,整网提速约 17%
值得精读。这个 PR 展示了在不改变数值语义的前提下做 kernel 融合的完整套路:先构造共享的 compact 表、再写一次性旋转 Q/K 的 CUDA kernel、用预检函数拦截一切不支持输入、用 bit-exact gate 在首次调用时自动验证并永久回退。对比数据(10 倍级加速 + 输出 SHA256 一致 + 显存不变)是很有说服力的验收标准。建议重点看 `ltx_2_5_diffusion_decoder.py` 的 `_tables`/`_apply_rope`/`forward_pair` 与 `ltx25_decoder_rope.cuh` 的 pair 旋转循环,理解"eager 顺序被严格保留"在 kernel 里是如何体现的(`__fmul_rn`/`__fsub_rn` 组合、避免 FMA)。唯一需要留意的是 gate 与全局缓存的生命周期管理,可作为后续讨论点。
参与讨论