#50298 [DSv4 Perf] Remove redundant full kernel for dsv4, 1.88x kernel performance improvement
原始 PR · 作者 yewentao256 · 合并时间 2026-07-30 23:39
移除冗余 torch.full 内核调用,提升 1.88x
建议精读该 PR。它展示了在 CUDA kernel 层面消除冗余启动的典型模式:通过预留工作空间和 out 参数复用缓冲区。设计决策(如 round_up 对齐、warmup 阶段的 workspace 预留)值得学习。
参与讨论