#34647 [AMD] Enable 12-head MLA aiter fp8 Gluon decode (batched bh16bn128).
原始 PR · 作者 chien-an-chen · 合并时间 2026-09-01 14:47
为 AMD GPU 启用 Kimi-K3 12 头 MLA FP8 Gluon 解码,显著提升长上下文吞吐。
该 PR 值得精读,尤其是以下设计决策:1) **运行时探针与优雅降级模式**:通过 `MlaGluonCapability` 数据类和分层检查(环境变量、导入、API 存在性),实现了对硬件和软件依赖的动态适应,是处理可选硬件加速功能的优秀范例。2) **零填充拓扑的泛化**:将原来的硬编码填充逻辑抽象为 `head_pad_mode`("repeat"/"zero"/"none"),为未来支持其他低头数模型(如 h4, h8)的优化提供了扩展点。3) **最小化变更边界**:尽管涉及核心解码路径,但通过清晰的条件判断和回退机制,确保了对非目标配置的零影响。