#40082 Integrate flashinfer b12x MoE and FP4 GEMM kernels for SM120/121
原始 PR · 作者 meena-at-work · 合并时间 2026-05-21 01:21
为 SM12x GPU 集成 FlashInfer b12x MoE 和 FP4 GEMM 后端
值得精读:该 PR 展示了如何将第三方自定义 kernel 后端集成到 vLLM 现有的量化 MoE 和 Linear 架构中,特别是 `process_weights_after_loading` 中的 scale 融合技巧。review 讨论中关于设计权衡 — 独立 backend 与复用 — 的对话也值得参考。
参与讨论