MXFP4 W4A4线性层支持,集成FlashInfer/Marlin内核
值得精读此PR。重点可关注`MxFp4LinearKernel`抽象类设计和`init_mxfp4_linear_kernel`工厂函数的多后端选择模式,以及如何通过环境变量`VLLM_MXFP4_USE_MARLIN`覆盖内核选择。compressed-tensors方案的重构方式(从直接调用Marlin到委托内核)也为其他量化格式统一提供了参考。此外,swizzle reshape的讨论展示了GPU编程中数据布局对齐的常见陷阱。
参与讨论