补齐 DeepGEMM 标准 MoE 调度,新增紧凑布局与 UE8M0 重量化
值得重点关注的设计点:masked/compact 布局启发式与 CUDA Graph 静态 buffer 的权衡、padding 行用 expert index -1 跳过无效数据的技巧、以及 UE8M0 直接量化激活以避免 2x 误差的精度处理。建议性能团队以本 PR 为基线,针对 compact 布局的 block_e 对齐与 masked/compact 交叉点做专项调优;合并者已批准,注意跟进 EP 路径 kernel 参数变更对其他调用点的影响。
参与讨论