Prhub

#29557 [cookbook] GLM-5.2 NVFP4 B300: TP8 recipe + 3 strategies

原始 PR 作者 zijiexia 合并时间 2026-06-30 05:42 文件变更 2 提交数 1 评论 3 代码增减 +74 / -8

执行摘要

GLM-5.2 NVFP4 B300 配置与基准更新

原有 cookbook 中的 GLM-5.2 NVFP4 B300 配置使用的是 TP4 布局,仅包含 low-latency 和 balanced 两种策略。实际验证表明单节点 8×B300 可以稳定运行 TP8 布局,且缺少 high-throughput 策略的指导。本次更新将 B300 NVFP4 配置升级为 verified 的 TP8 方案,并新增 high-throughput 策略,同时补充对应的性能数据,帮助用户根据负载场景选择合适的配置。

该 PR 为纯文档更新,内容清晰,已验证通过。建议合并。对于使用 GLM-5.2 NVFP4 的团队,值得参考 balanced 策略中的 --speculative-attention-mode decode--max-running-requests 调整经验。

讨论亮点

在 Issue 评论中,用户 tazjin 询问了两个问题:

  • dev-glm52-nvfp4 分支基于哪个 PR?
  • 此配置是否预期在 B200 上工作?

作者 zijiexia 回复:

  • 该分支基于 glm-opt 分支。
  • 预期可在 B200 上工作,将尽快提供更新。

说明该配置具有一定的跨硬件可移植性,但 B200 的具体部署验证和性能数据尚未正式发布。

实现拆解

  1. 更新部署配置 (docs_new/src/snippets/configs/zai-org/glm-5.2.jsx)

    • 将 B300 NVFP4 的 low-latency 和 balanced 策略从 --tp 4 改为 --tp 8--mem-fraction-static 从 0.8 改为 0.85。
    • 为 balanced 策略新增 --dp 8--enable-dp-attention、短 draft MTP 2-1-3、--speculative-attention-mode decode--max-running-requests 256 等关键参数,并添加注释说明 decode 模式避免 CUDA-graph 死锁、提升默认并发限制以充分利用 DP-Attention。
    • 新增 high-throughput 策略:TP8 + DP-Attention (dp8)、禁用 speculative、--max-running-requests 1024,定位极限吞吐场景。
    • 更新注释块,明确 B300 与 GB300 的 TP 差异。
  2. 补充性能基准数据 (docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx)

    • 为 B300 NVFP4 的三种策略添加了实测 latency 和 throughput 数据。
    • low-latency: 1/16 并发下 TTFT 196/274 ms, TPOT 1.86/6.95 ms, 吞吐 51/224 tok/s/GPU。
    • balanced: 64/256 并发下 TTFT 680/3010 ms, TPOT 48.9/149 ms, 吞吐 153/205 tok/s/GPU。
    • high-throughput: 1024 并发下 TTFT 6370 ms, TPOT 280 ms, 吞吐 430 tok/s/GPU。
    • 标注了 aime25 评分 (89.58) 及其来源(当前 NVFP4 构建实测)。
  3. 配置验证:两个 JSX 配置文件均通过 node --check 和模块导入验证,确保语法正确。

文件 模块 状态 重要度
docs_new/src/snippets/configs/zai-org/glm-5.2.jsx 部署脚本 modified 6.26
docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx 基准测试 modified 5.76

关键源码片段

docs_new/src/snippets/configs/zai-org/glm-5.2.jsx core-logic

核心部署配置,更新了 B300 NVFP4 的三种策略(low-latency、balanced、high-throughput),包括 TP 大小、DP-Attention 启用、speculative decoding 参数、内存比例等关键改动。

// 以下是 B300 NVFP4 balanced 策略的配置片段 (docs_new/src/snippets/configs/zai-org/glm-5.2.jsx)
{
  match: { hw: "b300", variant: "default", quant: "nvfp4", strategy: "balanced", nodes: "single" },
  verified: true,
  env: [],
  flags: [
    "--model-path {{MODEL_NAME}}",
    "--tp 8", // 从 tp4 升级到 tp8,充分利用 8 卡 B300
    "--dp 8", // 启用数据并行,提升吞吐
    "--enable-dp-attention", // 配合 DP 的分组注意力机制
    "--quantization modelopt_fp4",
    // 使用短 draft (MTP 2-1-3) 而非默认的 5-1-6:在此并发度下,
    // 长 draft 的校验开销超过了 accept-length 收益
    "--speculative-algorithm EAGLE",
    "--speculative-num-steps 2",
    "--speculative-eagle-topk 1",
    "--speculative-num-draft-tokens 3",
    // DP-Attention + MTP 需要两个必需标志:
    // decode 模式避免 CUDA-graph 捕获死锁,
    // max-running 256 提升默认约 48 请求的节流,使 DP-Attention 填满所有 8 个 rank
    "--speculative-attention-mode decode",
    "--max-running-requests 256",
    "--chunked-prefill-size 8192",
    "--mem-fraction-static 0.85", // 从 0.8 调高,分配更多 GPU 内存
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
},
docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx core-logic

性能基准数据,为 B300 NVFP4 的三种策略提供了实测的 TTFT、TPOT 和吞吐数据,并包含 accuracy 记录。

// B300 + NVFP4 基准条目 (docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx)
// tokens_per_sec_per_gpu = 总服务器输出 tok/s / 8 块 GPU
// aime25 覆盖变体默认值 (87.7→89.58,当前 NVFP4 构建实测 );gsm8k 继承默认值
{
  match: { hw: "b300", variant: "default", quant: "nvfp4", strategy: "balanced", nodes: "single" },
  sglang_version: "dev-glm52-nvfp4",
  accuracy: { aime25_pct: 89.58 },
  speed: [
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 64 },
      ttft_ms: 680, tpot_ms: 48.9, tokens_per_sec_per_gpu: 153 },
    { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 256 },
      ttft_ms: 3010, tpot_ms: 149, tokens_per_sec_per_gpu: 205 },
  ],
},

评论区精华

dev-glm52-nvfp4 分支基础与 B200 兼容性 question

用户 `tazjin` 询问预览镜像基于哪个 PR,以及配置是否可在 B200 上工作。

结论:作者 `zijiexia` 回复:该分支基于 `glm-opt` 分支,预期可在 B200 上工作,将尽快提供更新。 · 已解决

风险与影响

本次变更为纯文档/配置更新,不涉及任何运行时代码改动,技术风险极低。但需要注意的是:

  1. 配置准确性风险:所有配置依赖特定的 dev-glm52-nvfp4 预览镜像,若未来镜像或模型发生变更,配置可能需要同步更新。
  2. 硬件兼容性风险:作者确认预期可在 B200 上工作,但尚未提供 B200 的验证数据,用户在使用 B200 时需自行验证。
  3. 配置可复现性风险:部分性能数据基于特定实验环境(flush-cache、随机数据集),实际生产环境可能有所差异。
  • 用户/开发人员:为使用 GLM-5.2 NVFP4 模型的用户提供了经过验证的 B300 部署指南,覆盖从低延迟到高吞吐的三种典型场景,降低了配置调优门槛。
  • 系统性能:无直接影响,但正确的配置有助于充分利用硬件资源,提升推理效率。
  • 团队维护:配置文件结构清晰,注释详细,便于后续扩展其他硬件型号或策略。
预览镜像依赖 B200 兼容性未验证

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论