Prhub

vllm-project/vllm · 标签视图

标签列表

聚合结果

kv-cache 相关 PR

2026-08-07

#50276 [Bugfix] Fix packed KV block zeroing stride

原始 PR · 作者 wangxian001 · 合并时间 2026-08-07 04:49

缺陷修复 重要性 6.73 洞察度 6.00

修复 packed KV 清零步长,防止越界写与相邻数据污染

值得精读。重点关注两点:一是诊断方法论——异步 CUDA 错误下如何用同步检查点把“表象堆栈”收敛到真实写坏内存的环节,这一思路对排查同类 CUDA 内存损坏问题很有参考价值;二是实现上“块步长”与“清零页宽”解耦 + 虚拟块展开为独立 segment 的设计,可作为处理非均匀/非连续视图地址计算的范本。回归测试 `test_packed_segment_zeros_only_its_last_block_page` 短小但对回归覆盖非常精准。

2026-08-06
缺陷修复 重要性 6.81 洞察度 5.00

修复 hidden-state 缓存层破坏混合前缀缓存分块导致的启动崩溃

值得精读。此 PR 展示了典型的"隐式全局状态耦合导致启发式判断失效"的回归修复:EngineCore 全局重置 `cache_config.block_size` 的时序行为与 `kv_cache_utils` 推断逻辑之间的隐性依赖。修复思路(用模式判断替代数值比较、用 GCD 因子约束保证整除性)对维护 V1 hybrid KV cache 的工程师有直接参考价值;同时可关注 ivanium 提出的 follow-up:将 GCD 逻辑统一收敛进 `resolve_kv_cache_block_sizes`。