2026-09-01
新增 Mooncake 后端外部链接器,支持跨节点 KV 加载
值得精读。本 PR 展示了如何将外部分布式存储接入 unified cache:异步后台线程 + Future 计数器的 layer-wise 加载协议、跨 rank 的 restorable 集合求交、以及 buffer 注册与键后缀对齐等设计,都是可复用的模式。建议重点看 MooncakeDirectLinker.load_layer_wise 与 MooncakeStore.batch_exists_v2 的改动,理解 TRAILING_PAGES 空洞语义为什么必须返回集合而不是单一前缀长度。
SM90 新增 MXFP4 W4A8 MoE 路径,kernel 吞吐提升约 2 倍
值得精读。重点学习三点:1) 在全局 pin 旧版 FlashInfer 时如何以 opt-in 方式安全接入新内核并即时失败提示;2) 用 `preserve_expert_range` + `last_real` / `k_real` 处理对齐 padding 与预取整尾列,保证 Humming residual 数值稳定;3) 对上游 ABI(routed-row vs per-local-expert)变更的取舍与版本门控设计。
SM10X Command-A-Plus 解码提速 2.3 倍,BCG 捕获内存降 78%
值得精读。三项改动都落在核心路径且跨模块(模型实现 + 配置门控 + 白名单 + 测试),评分 7。重点学习:流的按角色租用如何规避缓存分配器分池导致的捕获 OOM;多流并行时 in-place 别名引发的跨流数据竞争及其消除方法;decode-only 重叠的收益边界(prefill 已饱和时事件开销大于收益);fail-closed 门控如何在不确定配置下避免把用户带进崩溃路径,并用"不可读配置"测试用例固化契约。
LayerNorm 序列并行:prefill 激活内存与延迟双降
值得精读,尤其三个设计决策:(1) CUDA graph 下捕获区内写入的 Python 标志在回放时过期这一问题的识别与 `runs_sp` 规避方案;(2) `LayerCommunicator` 构造全 `SCATTERED` sibling 的委托模式,避免在每个模型里打点;(3) fused matmul+collective 的可用性探测与普通 collective fallback 策略,兼顾性能与跨 torch 版本兼容性。对后续做任何序列切分、通信融合类特性都有直接参考价值。
trtllm_mla 解码路径支持 DCP,长上下文吞吐提升达 68%
值得精读。重点看三处设计决策:一是 `q_len == 1` 免全局因果边界的论证与其在 `_run_decode_kernel` 的门控实现(理解 DCP 内核契约的关键);二是 LSE 基数问题从 backend 内注册表方案演化到采纳 #34240 merge-site 约定的过程,展示了跨 PR 设计协同的正确姿势;三是 `_apply_dcp_cuda_graph_metadata` 三分支对 global / local 长度视图的维护,是 CUDA graph 捕获路径下容易出错但必须一致的典型样例。
FlashInfer CuTe DSL 新增 NVFP4 W4A16 模式,激活保持 BF16
值得精读,尤其关注以下设计决策:`quant_mode` 作为贯穿 dense/MoE/dispatcher/模型守卫的统一决议值如何避免分叉;`copy_or_rebind_param` 在 CUDA graph 与 disk reload 场景下保持 tensor 绑定的手法;W4A16 下对 FlashInfer A2A 强制 BF16 dispatch 而非引入第二套 workspace 的取舍。本 PR 的测试组织(online 精度 + reload 确定性 + lm head 守卫)也值得作为量化后端集成的参考样例。
unified 池泛化至 N 子池,新增浮动池支撑 mamba+SWA 三态 KV
值得精读。三个设计决策尤其值得关注:一是 `_CapacityField` 用数据描述符 + epoch 让容量 memo 失效"按构造"发生,避免了散落的失效钩子;二是 `_float_open_short_side` 的 demand-vector 策略,使单带宽短供、耦合多带分配、未来组合准入向量统一为一种表达;三是 `_relieve_for_alloc` 将 flush/relocate/evict 收敛为单一 ladder。建议结合 test_unified_capacity_memo.py 与 test_multi_ended_allocator.py 的测试方法论阅读,这两份测试的防御深度(属性测试 + 反射扫描 + 伪装写入探测)本身就值得借鉴。
统一内存按字节预算定容,新增守恒校验与 bs=1 可行性检查
值得精读。核心设计决策包括:allocator-owned hook + 默认逐位兼容、诊断只读不 raise 的可用性取舍、`_reserved_floor_bytes` 单一事实来源、方向无关的 chain 排序、flooring 而非 rounding 的 4096 B 对齐。对想理解 SGLang 统一内存池演进方向(N 子池、字节准入)的工程师,这是很好的中间态样例,建议结合 #35154 与 #35177 一起阅读。