#34066 perf(unified-memory): batch lazy-compaction mapping lookup
原始 PR · 作者 seokwoosong · 合并时间 2026-08-24 17:14
批量化映射查找消除 GPU-CPU 同步,unified-memory 吞吐最高提升 128%
值得精读。虽然改动只有 55 行,但精准命中了「逐行 `.item()` 同步」这一典型性能陷阱,`_commit_move_batch` 中「一次 gather + GPU 异步断言」的组合是可在其它同步敏感路径复用的优化范式;回归测试用 `_RejectScalarIndexTensor` 代理把「不得逐行读取映射」变成测试期即失败的硬约束,也是防御性测试的好例子。建议结合 #33060 的 Kimi-K3/GB200 数据一起阅读。
参与讨论