2026-09-01
SM90 新增 MXFP4 W4A8 MoE 路径,kernel 吞吐提升约 2 倍
值得精读。重点学习三点:1) 在全局 pin 旧版 FlashInfer 时如何以 opt-in 方式安全接入新内核并即时失败提示;2) 用 `preserve_expert_range` + `last_real` / `k_real` 处理对齐 padding 与预取整尾列,保证 Humming residual 数值稳定;3) 对上游 ABI(routed-row vs per-local-expert)变更的取舍与版本门控设计。
SM10X Command-A-Plus 解码提速 2.3 倍,BCG 捕获内存降 78%
值得精读。三项改动都落在核心路径且跨模块(模型实现 + 配置门控 + 白名单 + 测试),评分 7。重点学习:流的按角色租用如何规避缓存分配器分池导致的捕获 OOM;多流并行时 in-place 别名引发的跨流数据竞争及其消除方法;decode-only 重叠的收益边界(prefill 已饱和时事件开销大于收益);fail-closed 门控如何在不确定配置下避免把用户带进崩溃路径,并用"不可读配置"测试用例固化契约。
放宽 FLA/MoE 共享内核 shape 上限,grid 拆分避免超限
值得精读,尤其适合 kernel 开发者与多模态/新模型 day0 支持方向的工程师。三个值得借鉴的设计决策:一是把「易超限的折叠轴拆到独立 grid 轴」作为通用模式,可平移到其他 Triton kernel;二是从 `stride(0)` 而不是 `shape[1]` 推导 per-request 缓存步数,以适配 adaptive speculative decoding 下运行时形状变化,这是一个容易被忽略的正确性细节;三是多 block-per-row 拆分隐藏维度的做法,解除了 `out_dim <= 1024 * kVecSize` 的隐性限制。合入前建议确认 CI 失败原因,并在 main 分支补齐新模型大 shape 场景的显式验证。
FlashInfer CuTe DSL 新增 NVFP4 W4A16 模式,激活保持 BF16
值得精读,尤其关注以下设计决策:`quant_mode` 作为贯穿 dense/MoE/dispatcher/模型守卫的统一决议值如何避免分叉;`copy_or_rebind_param` 在 CUDA graph 与 disk reload 场景下保持 tensor 绑定的手法;W4A16 下对 FlashInfer A2A 强制 BF16 dispatch 而非引入第二套 workspace 的取舍。本 PR 的测试组织(online 精度 + reload 确定性 + lm head 守卫)也值得作为量化后端集成的参考样例。
升级 sgl-deep-gemm 至 0.1.7,MegaMoE 改用 mma_type API 支持 MXFP4
值得精读,尤其是两个设计点:一是对称 buffer 缓存 key 纳入 mma_type 的隔离思路,避免了跨类型 buffer 串用的隐性 bug;二是 _interleave_mega_moe_gate_up 同时支持 gran=8 连续交错与 gran=16 even/odd 交错两种布局,展示了如何在同一函数内兼容不同上游内核的权重排布。对依赖升级类 PR,这种“版本钉版 + 调用点迁移 + 行为回归测试”的配套做法也值得借鉴。