Prhub

#36513 GLM-5.3-Flash cookbook: FP8 KV + TRT-LLM benchmark cards and Blackwell default

原始 PR 作者 JustinTong0323 合并时间 2026-08-26 22:39 文件变更 3 提交数 3 评论 0 代码增减 +84 / -4

执行摘要

GLM-5.3-Flash cookbook 新增 FP8 KV + TRT-LLM 基准卡并设为 Blackwell 默认

根据 PR body,原 cookbook(#36440)提供 FP8 KV + TRT-LLM DSA 作为仅 Blackwell 的叠加选项,但基准卡片只按硬件和匹配维度(hw、strategy)键控,导致选择该选项后仍显示 BF16 + TileLang 的旧数据,且该选项没有任何测量数据。实测显示 FP8 KV + TRT-LLM 在所有行都比 BF16 + TileLang 快,且 KV 容量约 1.8 倍、质量相当,因此本 PR 将其设为 Blackwell 的默认配对。

建议阅读此 PR,因为它展示了如何在文档生成的源码中处理多维度的配置匹配,尤其是 findBenchmark 的“最具体匹配优先”设计,这是一种可复用的模式。同时,对于 Blackwell 用户,本 PR 的默认配置变更值得关注。

讨论亮点

本 PR 无 review 评论,仅有一位审核者 zijiexia 给出了 APPROVED 状态,且无具体评论内容。因此没有可提炼的讨论或争议点。

实现拆解

  1. 修改 findBenchmark 匹配逻辑:在 docs/src/snippets/_deployment.jsx 中,将 findBenchmark 从仅按 DIMENSIONS(硬件和策略)精确匹配,改为遍历所有条目,检查 b.match 中每个声明的键是否与当前选择 sel 对应的值相等;若存在多个匹配,则按 Object.keys(b.match).length 降序排序,优先返回声明键最多的条目,即最具体的匹配。这使基准条目可以基于额外的 overlay 维度(如 kvDsaPair)进行区分,同时保留原有的 hw×strategy 条目作为回退。
  2. 新增 FP8 + TRT-LLM 基准数据:在 docs/src/snippets/configs/zai-org/glm-5.3-flash-benchmarks.jsx 中新增了 4 条基准记录,分别对应 GB300 低延迟(1 行)和高吞吐(3 行,并发 16/64/256)场景,每条记录的 match 都包含 kvDsaPair: "fp8-trtllm",并附上实测的吞吐、TTFT、TPOT 数据。
  3. 调整默认配置与验证状态:在 docs/src/snippets/configs/zai-org/glm-5.3-flash.jsx 中,将 GB300 的低延迟和高吞吐两个 cell 的 verificationStatus 扩展为:当选择为推荐配置或满足 kvDsaPair === "fp8-trtllm" && mmTransport === "auto" && hicache === "off" 时显示 verified,否则为 unverified。同时将两个 cell 的默认 flags 中 DSA 后端切换为 TRT-LLM、KV cache dtype 改为 fp8_e4m3。此外,PR body 提到 Hopper(H100/H200)上该选项被禁用并自动重置为 BF16 + TileLang,但相关逻辑未在提供的片段中直接体现。
  4. 测试与校验:PR 中提到测试了引擎节点 harness(5/5 findBenchmark 用例)和组合命令断言(12/12),但未包含对应的测试文件变更,可能只是手动验证或未纳入版本控制。
文件 模块 状态 重要度
docs/src/snippets/_deployment.jsx 部署文档 modified 6.2
docs/src/snippets/configs/zai-org/glm-5.3-flash-benchmarks.jsx 基准数据 modified 6.37
docs/src/snippets/configs/zai-org/glm-5.3-flash.jsx 配置文档 modified 5.4

关键符号

findBenchmark

关键源码片段

docs/src/snippets/_deployment.jsx core-logic

修改了基准查找逻辑 findBenchmark,使其支持基于 overlay 维度的匹配,这是本次变更的核心逻辑。

// findBenchmark 现在支持按 overlay 维度(如 kvDsaPair)匹配:
// 当一个条目的 match 中所有键都与当前选择相等时,该条目适用;
// 多个匹配时,声明键最多的条目(最具体)优先,
// 因此原有的 hw×strategy 条目成为回退选项。
const findBenchmark = (list, sel) => {
  // 过滤出所有 match 中每个键都与当前选择相等的条目
  const hits = (list || []).filter((b) =>
    Object.entries(b.match || {}).every(([k, v]) => sel[k] === v));
  // 按 match 声明的键数量降序排序,取最具体的条目
  return hits.sort((a, b) =>
    Object.keys(b.match).length - Object.keys(a.match).length)[0] || null;
};
docs/src/snippets/configs/zai-org/glm-5.3-flash-benchmarks.jsx core-logic

新增了 FP8 KV + TRT-LLM DSA 的基准数据,这些数据将用于展示特定组合的性能。

// 新增的基准条目示例:
// 通过 match 中的 kvDsaPair 区分同一硬件和策略下的不同 KV/DSA 组合。
{
  // 匹配 GB300 低延迟且 kvDsaPair 为 fp8-trtllm 的选择
  match: { hw: "gb300", strategy: "low-latency", kvDsaPair: "fp8-trtllm" },
  sglang_version: "f13cb6f6a7",
  latencyPercentile: "Mean",
  speed: [
    {
      workload: { dataset: "random", isl: 1024, osl: 256,
                   max_concurrency: 16, num_prompts: 80 },
      ttft_ms: 583.36,
      tpot_ms: 6.21,
      tokens_per_sec_per_gpu: 2357.1,
    },
  ],
}
docs/src/snippets/configs/zai-org/glm-5.3-flash.jsx core-logic

调整了 GB300 的默认配置和验证状态,使其对 FP8 + TRT-LLM 组合显示为已验证。

// GB300 低延迟 cell 的验证状态:
// 当选择为推荐配置或满足特定条件(kvDsaPair 为 fp8-trtllm 且 mmTransport 为 auto、hicache 为 off)时,
// 标记为已验证,否则未验证。
verificationStatus: (s) =>
  config.isRecommendedSelection(s) ||
  (s.kvDsaPair === "fp8-trtllm" && s.mmTransport === "auto" && s.hicache === "off")
    ? "verified"
    : "unverified",// 默认 flags 示例:切换 DSA 后端为 trtllm,KV cache dtype 为 fp8_e4m3
flags: [
  "--model-path {{MODEL_NAME}}",
  "--tp-size 4",
  "--ep-size 4",
  "--dsa-prefill-backend trtllm",
  "--dsa-decode-backend trtllm",
  "--kv-cache-dtype fp8_e4m3",
  "--moe-runner-backend deep_gemm",
  // ... 其他参数
]

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  1. 默认配置变更风险:将 Blackwell 默认 KV cache dtype 从 bfloat16 改为 fp8_e4m3 并切换 DSA 后端,可能影响实际部署的用户配置,若用户未显式指定,可能会采用新的默认值,需注意兼容性。
  2. 基准匹配逻辑变更风险findBenchmark 的匹配逻辑从精确匹配改为“所有声明键匹配 + 最具体优先”,若现有基准条目的 match 键与 sel 中的额外维度(如 kvDsaPair)未设置,可能导致匹配结果不符合预期,例如旧的 hw×strategy 条目可能被新的具体条目覆盖,需验证现有配置是否受影响。
  3. 文档与代码一致性:PR 修改了配置文件和基准数据,但未发现相应的测试文件变更,若相关逻辑存在回归,可能未被自动测试覆盖。

影响范围:主要影响 GLM-5.3-Flash cookbook 文档的展示逻辑和默认推荐配置,对正在使用该文档部署 Blackwell GPU 的用户有直接影响。
影响程度:中等。改动集中在文档生成引擎的基准匹配逻辑和配置文件,不涉及核心运行时逻辑,但默认配置的变更可能影响用户的实际部署命令。
对团队的影响:为 cookbook 维护者和使用 Blackwell 的用户提供了更准确的基准数据和推荐配置,减少了混淆。

默认配置变更 匹配逻辑变更 缺少测试覆盖

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论