Prhub

#28460 docs(cookbook): verify GLM-5.2 single-node B300 (FP8 + BF16)

原始 PR 作者 JustinTong0323 合并时间 2026-06-17 11:47 文件变更 3 提交数 2 评论 1 代码增减 +76 / -23

执行摘要

B300 GLM-5.2 验证结果更新至 cookbook

验证 GLM-5.2 在 B300(Blackwell Ultra, sm103)上的实际部署性能,为用户提供准确的基准数据。PR body 明确提到这是 #28448 的后续,通过实测将之前推断的“pending”状态标记为已验证,解决社区对 B300 支持状态的疑问。

建议精读。该 PR 体现了规范的硬件支持验证流程:先推断 → 实测 → 更新文档。PR body 对性能差异的解释(B300 比 B200 慢的原因)具有参考价值,可作为 Blackwell 系列跨代性能分析的案例。

讨论亮点

无实质讨论。只有一行来自 gemini-code-assist 的 quota 提醒。审核者 zijiexia 直接批准。

实现拆解

  1. benchmarks 数据填充glm-5.2-benchmarks.jsx):为 B300 的 6 个单节点配置(FP8/BF16 × 3 种策略)添加实测 TTFT、TPOT 和吞吐量数据,并附注释说明 B300 与 B200 的性能差异原因。
  2. 配置状态标记glm-5.2.jsx):将 B300 所有 6 个单节点配置的 verifiedfalse 改为 true,更新注释描述实测结果和已知限制(BF16 未启用 DP-Attention/DeepEP 导致高并发下吞吐较低)。
  3. cookbook 描述更新GLM-5.2.mdx):在简介中增加对 B300 的支持说明,并在 CP 相关段落补充 B300 无需额外配置的说明。
  4. 多节点配置保留 pending:9 个 BF16 多节点配置因无 InfiniBand 试验环境,仍保持 verified: false,并在注释中说明原因。
文件 模块 状态 重要度
docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx 基准配置 modified 6.38
docs_new/src/snippets/configs/zai-org/glm-5.2.jsx 配置片段 modified 6.03
docs_new/cookbook/autoregressive/GLM/GLM-5.2.mdx 部署文档 modified 3.01

关键源码片段

docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx core-logic

核心变更:为 B300 的 FP8/BF16 各 3 种策略填充实测 TTFT/TPOT 吞吐量数据,替换原先的 pending 占位对象。

// 文件:glm-5.2-benchmarks.jsx ( 片段 )
// 注意:B300 (sm103) 因 deep_gemm/DSA 内核未优化,单 GPU 性能低于 B200 (sm100)
...
  // ---- B300 + FP8 ---- (8-GPU single node, TP8; measured on v0.5.13.post1)
  {
    match: { hw: "b300", variant: "default", quant: "fp8", strategy: "low-latency", nodes: "single" },
    sglang_version: "0.5.13.post1",
    speed: [
      // 低并发:TTFT 503 ms, TPOT 3.24 ms, 34 tokens/s/GPU
      { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1 },
        ttft_ms: 503, tpot_ms: 3.24, tokens_per_sec_per_gpu: 34 },
      // 16 并发:TTFT 4731 ms, TPOT 9.56 ms, 140 tokens/s/GPU
      { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 16 },
        ttft_ms: 4731, tpot_ms: 9.56, tokens_per_sec_per_gpu: 140 },
    ],
  },
...
docs_new/src/snippets/configs/zai-org/glm-5.2.jsx core-logic

关键变更:将 B300 的 FP8/BF16 各 3 种策略的 verified 字段从 false 改为 true,并更新注释说明实测状态和已知限制。

// 文件:glm-5.2.jsx ( 片段 )
// B300 + FP8 已验证,注释说明内核优化状态
  {
    match: { hw: "b300", variant: "default", quant: "fp8", strategy: "low-latency", nodes: "single" },
    verified: true, // 之前是 false
    env: [],
    flags: [
      "--model-path {{MODEL_NAME}}",
      "--tp 8",
      "--speculative-algorithm EAGLE",
      "--speculative-num-steps 5",
      "--speculative-eagle-topk 1",
      "--speculative-num-draft-tokens 6",
      "--mem-fraction-static 0.8",
      "--cuda-graph-max-bs 32",
      "--host {{HOST_IP}}",
      "--port {{PORT}}",
    ],
  },
...

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  1. 性能数据准确性风险:benchmark 数据仅基于单一 8×B300 节点,且使用特定软件版本(v0.5.13.post1),其他环境可能表现不同。但标注了版本并声明缓存清理,数据可信度较高。
  2. 多节点配置误导风险:多节点配置仍标记为 verified: false,但用户可能忽略该状态而直接参考单节点配置,需关注文档中的显式标注。
  3. 版本依赖风险:配置依赖具体 sglang 版本,未来版本变更可能导致配置失效,但这是 cookbook 类文档的固有风险。
  1. 用户影响:为计划在 B300 上部署 GLM-5.2 的社区用户提供了直接可用的配置模板和性能参考,减少了试错成本。
  2. 系统影响:无代码更改,仅文档/配置文件更新,不影响运行时行为。
  3. 团队影响:无。
数据基于单节点测试 多节点配置未验证

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论