Prhub

#36608 [AMD] Add GLM-5.3-Flash recipes for MI300X, MI325X, and MI355X

原始 PR 作者 andyluo7 合并时间 2026-08-27 13:19 文件变更 3 提交数 1 评论 0 代码增减 +112 / -12

执行摘要

为 GLM-5.3-Flash 新增 AMD ROCm 部署配方

PR body 明确说明动机:为 zai-org/GLM-5.3-Flash 提供可复制粘贴的 AMD ROCm 部署配方,与现有 NVIDIA 配方并列;AMD 命令依赖 #36607 的引擎改动(该 PR stacked on 模型支持 PR #36507)。作者同时强调只做 accuracy/correctness 验证,不发布任何吞吐/延迟声明,MI325X 未直接测量故保持未验证标注。

值得快速阅读的文档型 PR。它展示了如何在 cookbook 配置面板中为未验证平台保留入口但禁用危险组合,并在基准数据中严格区分验证与推断、准确性测量与性能声明;对后续新增硬件配置和维护文档纪律有参考价值,无需深读代码。

讨论亮点

本 PR 没有任何 review 评论,审核者 zijiexia 直接 APPROVED。公开讨论集中在 PR body 的验证纪律上:不发布未测量的性能数字、MI325X 显式标注为未验证、未验证的 MTP/FP8 组合直接在面板中禁用。

实现拆解

  1. 扩展硬件矩阵docs/src/snippets/configs/zai-org/glm-5.3-flash.jsxsupportedHardware 新增 mi300xmi325xmi355xisRecommendedSelection 将三者与 h100h200 一样映射到 bf16-tilelang 推荐配对。
  2. 禁用未验证组合:同一文件中对 AMD 禁用 low-latency(Adaptive MTP 5/1/6)、fp8-trtllm(FP8 KV + TRT-LLM DSA)以及 deep_gemm MoE runner,避免用户踩到未经验证的路径;同时新增 AMD 专用 ROCm 7.2 镜像映射(v0.5.18-rocm720-mi30x / mi35x)和 TP8 非投机操作点命令。
  3. 记录准确度基准docs/src/snippets/configs/zai-org/glm-5.3-flash-benchmarks.jsx 新增 MI300X(GSM8K 97.35%)与 MI355X(97.65%)两个 accuracy-only 条目,记录模型修订、引擎 head、source manifest SHA256、镜像和请求统计;MI325X 仅保留占位匹配行,不附带任何数据。
  4. 更新文档说明docs/cookbook/autoregressive/GLM/GLM-5.3-Flash.mdx 同步修改 description、安装指引、策略说明与精度表格,说明 AMD 仅提供 High Throughput 配方且依赖 PR #36607 的引擎改动。
  5. 配套验证:文档侧通过 node docs/scripts/check_cookbook_configs.mjs、pre-commit、mintlify broken-linksmintlify validate;无自动化测试改动,CI 的 AMD ROCm 7.2 作业未在本次 commit 上运行。
文件 模块 状态 重要度
docs/src/snippets/configs/zai-org/glm-5.3-flash.jsx 配方配置 modified 6.5
docs/src/snippets/configs/zai-org/glm-5.3-flash-benchmarks.jsx 基准记录 modified 5.07
docs/cookbook/autoregressive/GLM/GLM-5.3-Flash.mdx 使用文档 modified 3.39

关键源码片段

docs/src/snippets/configs/zai-org/glm-5.3-flash.jsx core-logic

本次变更的核心配置文件:扩展硬件支持矩阵,为 AMD 禁用未验证的 MTP、FP8 + TRT-LLM 与 deep_gemm 组合,并新增 ROCm 7.2 镜像与 TP8 操作点命令,所有 AMD 配方逻辑都集中在此。

// 以下为整理后的 AMD 门控逻辑片段;原文件中的这些判断以内联数组形式出现
const AMD_HW = ["mi300x", "mi325x", "mi355x"];// 1) low-latency(Adaptive MTP 投机解码)在 AMD 上未验证,直接禁用,
// 引导用户使用非投机的高吞吐配方
{
  id: "low-latency",
  label: "Low Latency",
  disabled: (s) => AMD_HW.includes(s.hw),
  disableReason:
    "MTP speculative decoding has not been validated for GLM-5.3-Flash on AMD ROCm; " +
    "use the non-speculative High Throughput recipe.",
},// 2) 推荐配对随硬件切换:AMD 与 Hopper 一样使用 BF16 KV + TileLang DSA
const pairing = ["h100", "h200", ...AMD_HW].includes(s.hw)
  ? "bf16-tilelang"
  : "fp8-trtllm";// 3) FP8 KV + TRT-LLM DSA 在 AMD 上同样禁用,避免未经验证的组合
{
  id: "fp8-trtllm",
  label: "FP8 + TRT-LLM",
  disabled: (s) => ["h100", "h200", ...AMD_HW].includes(s.hw),
  disableReason: "This recipe uses BF16 KV cache with TileLang DSA on Hopper and AMD ROCm GPUs.",
},// 4) AMD 使用专门构建的 ROCm 7.2 镜像;引擎改动未进镜像时需挂载 PR #36607 源码。
// mi325x 与 mi300x 共用 gfx942 镜像,但未直接验证
const dockerImages = {
  mi300x: "lmsysorg/sglang:v0.5.18-rocm720-mi30x",
  mi325x: "lmsysorg/sglang:v0.5.18-rocm720-mi30x",
  mi355x: "lmsysorg/sglang:v0.5.18-rocm720-mi35x",
};
docs/src/snippets/configs/zai-org/glm-5.3-flash-benchmarks.jsx data-contract

新增 MI300X 与 MI355X 的 accuracy-only 基准记录,并刻意让 MI325X 只保留占位匹配行,体现验证与推断的严格区分。

// 新增 AMD 记录只包含准确度数据,刻意不写吞吐或延迟,避免无基准支撑的性能声明
{
  match: { hw: "mi300x", strategy: "high-throughput" },
  sglang_version: "9e692c9216",
  accuracy: { gsm8k_pct: 97.35 },
  notes:
    "Accuracy-only validation on 8x MI300X (gfx942, TP8) with model revision " +
    "3f1971b7b5f7a528c9c4ef6212c8785298a8c24a, PR #36607 head 9e692c9216, " +
    "image lmsysorg/sglang:v0.5.18-rocm720-mi30x. Full GSM8K 1,284/1,319, " +
    "100% stop rate, zero errors. No throughput or latency benchmark was run.",
},
// MI325X 只有占位匹配行:共享 gfx942 但未直接测量,因此不附任何数据
{ match: { hw: "mi325x", strategy: "high-throughput" } },

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  • 配方依赖未合入的 PR #36607,用户在公共镜像上直接复制命令可能因引擎缺失而失败;文档已注明需挂载 PR 源码分支,但仍存在误导风险。
  • MI325X 与 MI300X 同为 gfx942 但未直接测量,显存带宽/容量差异可能导致实际 KV 池与 batch 行为不同,文档以占位条目处理,未给出任何数字。
  • 配置面板强制禁用 AMD 上的 MTP 与 FP8 + TRT-LLM,可能阻断社区在 AMD 上的自发验证,属于有意的保守选择。
  • CI 未覆盖该 commit 的 AMD ROCm 7.2 作业,验证依赖人工执行,存在回归盲区。
  • 用户:AMD 用户可获得开箱即用的 GLM-5.3-Flash 高吞吐 TP8 部署命令,避免误用未验证组合;NVIDIA 用户不受影响。
  • 系统:无任何运行时代码或配置变更,风险面仅限于文档面板。
  • 团队:建立了“未验证即禁用 + 显式标注推断硬件”的 cookbook 模式,为后续 AMD 配方提供可复制范例。
依赖未合入引擎 PR #36607 MI325X 未直接验证 文档配方无自动化测试 AMD CI 未覆盖该 commit

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论