执行摘要
融合 FP8 DeepGemm 量化内核的零初始化,实现约 1% 解码加速。
根据 PR 描述,当前 per_token_group_quant_fp8_packed_for_deepgemm 需要调用 torch::stable::zero_(output_s_packed) 来初始化尺度缓冲区,这引入了额外开销。通过在内核中直接为零填充索引写入零,可以消除此初始化调用,在 Minimax M2.5 FP8 并发 128 1K/1K 解码中节省 2 * 1.2 us(层时间的约 1%),实现端到端加速。
建议技术管理者和工程师精读此 PR,重点关注内核中填充处理的实现细节和测试用例的设计。这展示了如何通过融合初始化来优化性能关键路径,同时确保正确性,值得学习其内核优化技巧。
Review 中未出现实质性讨论。gemini-code-assist[bot] 指出变更支持填充和 TMA 对齐,并添加了测试,但无反馈;mgoin 简单批准(LGTM)。无争议点或未解决疑虑。
参与讨论