#49236 [DSv4 Perf] Optimize workspace reuse for eager break
原始 PR · 作者 yewentao256 · 合并时间 2026-07-31 23:45
DSv4 eager 路径新增模型级缓冲池复用工作区,小幅优化 TTFT
值得精读。重点学习两个设计决策:一是 `_packed_size` 用 max 而非 sum 合并互斥 scratch 的思想——通过在注释中明确三类用途的 C4/C128 对齐约束来证明互斥性;二是 C++ 算子 out 变体模式(`..._insert_out`),把 kernel 内部分配改为调用方预分配,是削减 eager 路径分配开销的通用手法。对从事 CUDA Graph eager break、MLA 类模型优化或 kernel workspace 管理的工程师有直接参考价值。结合 review 中关于接口隐式约束的讨论,也能看到 vLLM 对函数接口友好性的坚持。
参与讨论