MLX 后端窗口化 SWA KV 存储并新增图内采样
值得精读。这是 MLX 后端迄今最重要的 PR 之一,建议重点关注三个设计决策: 1. **图内 Gumbel-max 采样如何与 overlap 调度器共存**——chaining 属性保住了 0.05-1.2 ms/step,而 body 诚实披露采样本身在 batch 64 时要 0.5-24 ms/step,这个取舍框架可以直接借鉴; 2. **SWA 前缀全量重算的取舍**——用精确性论证代替启发式优化,并明确标注"后续 SWARadixCache 恢复快速命中"的演进路径; 3. **bounded top-K 链与 murmur hash 移植**——把 CUDA 语义搬到 `mx` 平台时如何保持 seeded 行与 batch 组成无关的契约。 同时注意其性能数字都是低并发 Apple Silicon 本地 serving 场景,推广到高并发服务前需重新验证。