Prhub

#29674 docs: add B200 NVFP4 recipes + benchmarks to GLM-5.2 cookbook

原始 PR 作者 zijiexia 合并时间 2026-06-30 05:06 文件变更 2 提交数 1 评论 1 代码增减 +97 / -4

执行摘要

为 GLM-5.2 cookbook 添加 B200 NVFP4 部署配方与基准数据

扩展 GLM-5.2 cookbook 以支持 B200 硬件上的 NVFP4 量化部署,为用户提供经过验证的启动参数和实测性能数据,降低在 Blackwell 架构上部署该模型的门槛。

此 PR 适合有 GLM-5.2 在 B200 NVFP4 上部署需求的工程师精读,配置参数和性能数据可作为 baseline 参考。其他角色可快速浏览了解新硬件覆盖情况。

讨论亮点

无实质性讨论。PR 由 Fridge003 直接批准,review 评论数为 0。

实现拆解

  1. Docker 镜像映射:在 glm-5.2.jsxdockerImages 对象中增加 "b200|nvfp4": "lmsysorg/sglang:dev-glm52-nvfp4",为 B200 NVFP4 指定需要的预览镜像。

  2. 部署配置单元:在 glm-5.2.jsx 的配置数组末尾添加三个对象,分别对应低延迟(low-latency)、均衡(balanced)和高吞吐(high-throughput)策略。每个对象包含 match 匹配规则(hw/b200, quant/nvfp4)和 flags(启动参数),如低延迟使用 TP8 + EAGLE MTP 5-1-6,均衡和高吞吐额外启用 --dp 8 --enable-dp-attention

  3. 基准测试数据:在 glm-5.2-benchmarks.jsx 中添加三个 benchmark 条目,记录三组 workload 下的 TTFT、TPOT 和每 GPU 吞吐量(tok/s/GPU)。所有数据基于 dev-glm52-nvfp4 预览镜像测得,并附有随机数据集的 ISL/OSL 设定。

文件 模块 状态 重要度
docs_new/src/snippets/configs/zai-org/glm-5.2.jsx 部署配置 modified 6.67
docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx 性能基准 modified 6.13

关键源码片段

docs_new/src/snippets/configs/zai-org/glm-5.2.jsx core-logic

核心配置文件:添加了 B200 NVFP4 的 Docker 镜像映射和三个部署策略的启动参数。

// Docker 镜像映射:B200 NVFP4 需要 dev-glm52-nvfp4 预览镜像
dockerImages: {
  h200: "lmsysorg/sglang:latest",
  b200: "lmsysorg/sglang:latest",
  gb300: "lmsysorg/sglang:latest",
  b300: "lmsysorg/sglang:latest",
  // NVFP4 需要 modelopt_fp4 支持,使用 dev 镜像
  "b200|nvfp4": "lmsysorg/sglang:dev-glm52-nvfp4",
  "b300|nvfp4": "lmsysorg/sglang:dev-glm52-nvfp4",
  "gb300|nvfp4": "lmsysorg/sglang:dev-glm52-nvfp4",
},// B200 NVFP4 部署策略单元(NVFP4 量化,TP8)
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "low-latency", nodes: "single" },
  verified: true,
  env: [],
  flags: [
    "--model-path {{MODEL_NAME}}",
    "--tp 8",
    "--quantization modelopt_fp4",
    "--speculative-algorithm EAGLE",
    "--speculative-num-steps 5",
    "--speculative-eagle-topk 1",
    "--speculative-num-draft-tokens 6",
    "--chunked-prefill-size 8192",
    "--mem-fraction-static 0.85",
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
},
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "balanced", nodes: "single" },
  verified: true,
  env: [],
  flags: [
    "--model-path {{MODEL_NAME}}",
    "--tp 8",
    "--quantization modelopt_fp4",
    "--dp 8",
    "--enable-dp-attention",
    // 均衡策略使用较短的 MTP 2-1-3 以避免长草稿的验证开销
    "--speculative-algorithm EAGLE",
    "--speculative-num-steps 2",
    "--speculative-eagle-topk 1",
    "--speculative-num-draft-tokens 3",
    // 增大 chunked-prefill 以平衡批处理
    "--chunked-prefill-size 32768",
    "--mem-fraction-static 0.92",
    "--max-running-requests 256",
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
},
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "high-throughput", nodes: "single" },
  verified: true,
  env: [],
  flags: [
    "--model-path {{MODEL_NAME}}",
    "--tp 8",
    "--quantization modelopt_fp4",
    "--dp 8",
    "--enable-dp-attention",
    "--chunked-prefill-size 32768",
    "--mem-fraction-static 0.92",
    "--max-running-requests 512",
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
},
docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx core-logic

基准数据文件:新增 B200 NVFP4 的三个 benchmark 条目,包含低延迟、均衡、高吞吐的 P50 性能数据。

// ---- B200 + NVFP4 ---- (8-GPU 单节点,TP8;nvidia/GLM-5.2-NVFP4 通过 --quantization modelopt_fp4,
// 使用 dev-glm52-nvfp4 预览镜像,每次运行前刷新缓存。
// ttft_ms/tpot_ms 为 P50;tokens_per_sec_per_gpu = 输出 tok/s/GPU。
// 均衡和高吞吐额外启用 DP-Attention(dp8);低延迟使用 MTP 5-1-6,均衡使用 MTP 2-1-3)
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "low-latency", nodes: "single" },
  sglang_version: "dev-glm52-nvfp4",
  speed: [
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1 },
      ttft_ms: 295, tpot_ms: 1.85, tokens_per_sec_per_gpu: 58.6 },
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 16 },
      ttft_ms: 2491, tpot_ms: 5.43, tokens_per_sec_per_gpu: 254.3 },
  ],
},
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "balanced", nodes: "single" },
  sglang_version: "dev-glm52-nvfp4",
  speed: [
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 64 },
      ttft_ms: 5837, tpot_ms: 12.70, tokens_per_sec_per_gpu: 418.9 },
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 256 },
      ttft_ms: 16736, tpot_ms: 30.00, tokens_per_sec_per_gpu: 593.7 },
  ],
},
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "high-throughput", nodes: "single" },
  sglang_version: "dev-glm52-nvfp4",
  speed: [
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1024 },
      ttft_ms: 130174, tpot_ms: 67.12, tokens_per_sec_per_gpu: 589.4 },
  ],
},

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

作为纯文档修改,无代码逻辑变更,风险极低。潜在风险包括:

  • Docker 镜像 lmsysorg/sglang:dev-glm52-nvfp4 为预览版,后续可能更新或废弃,导致配方失效。
  • 基准数据在特定环境下测得,用户硬件或版本差异可能无法复现。

影响范围仅限于 cookbook 文档页面,用户可查阅并复制粘贴新的部署方案。团队其他部分无需适配。对系统无运行时影响。

依赖特定 Docker 镜像版本 基准环境不可完全复现

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论