#28287 [HiCache] Optimize HiCache hash generation with bulk token byte conversion
原始 PR · 作者 huangtingwei9988 · 合并时间 2026-07-01 15:44
将 HiCache L3 哈希生成从 Python per-token 循环改为 C++ native 扩展,实现约 70× 加速
值得精读。该 PR 展示了一种典型的热点路径优化模式:识别 Python 循环瓶颈,通过 C++ 扩展和 AVX2 指令集大幅加速,同时保持 Python 调用的便利性。设计决策中关于 per-page scratch buffer 的使用、bigram 重叠对的生成、以及优先利用已有 `array` 缓冲区避免额外拷贝的思想,值得在其他性能敏感模块中借鉴。
参与讨论