Prhub

#37351 [Cookbook] Add NVFP4 options for DeepSeek-V4 Flash Official (0731) and Pro Official (0813)

原始 PR 作者 zijiexia 合并时间 2026-09-01 16:03 文件变更 3 提交数 2 评论 1 代码增减 +189 / -2

执行摘要

为 DeepSeek-V4 官方变体添加 NVFP4 配置选项。

如 PR body 所述:'NVIDIA published NVFP4 quantizations of the official DeepSeek-V4 checkpoints — nvidia/DeepSeek-V4-Flash-0731-NVFP4 and nvidia/DeepSeek-V4-Pro-0813-NVFP4 — but the cookbook only offers NVFP4 on the original Flash/Pro variants. This PR makes NVFP4 selectable for the Flash Official (0731) and Pro Official (0813) variants.'

该 PR 值得精读,特别是对 cookbook 配置维护者。它展示了如何扩展配置以支持新变体,并考虑了版本兼容性(nightly 镜像)和验证状态管理。设计决策如使用 DSPARK 算法和针对硬件组合的配置模式值得借鉴。

讨论亮点

审核者 wisclmy0611 批准了 PR,没有提出任何异议或讨论,表明配置变更符合预期。

实现拆解

  1. 更新模型名称映射:在 docs/src/snippets/configs/deepseek-ai/deepseek-v4.jsxmodelNames 对象中,为 flash-officialpro-official 变体添加了 NVFP4 映射到对应的 NVIDIA Hugging Face 仓库。这使 cookbook 能够正确引用模型路径。
  2. 添加命令行配置单元:在同一文件中,为 B200、B300、GB200、GB300 硬件添加了新的低延迟策略配置单元。这些单元使用 --speculative-algorithm DSPARK 而不是 EAGLE/MTP 标志,因为官方检查点捆绑了 DSpark 草稿头。所有新单元标记为未验证(verified: falseverificationStatus: "in-progress"),风险可控。
  3. 修复 Docker 镜像映射:在 dockerImages 部分,添加了针对 NVFP4 检查点的 nightly 镜像映射(如 "b200|nvfp4": "lmsysorg/sglang:dev"),因为这些检查点在 v0.5.18 版本上崩溃,需要使用开发镜像。
  4. 更新准确度数据:在 docs/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx 中,为 B200 硬件上的 flash-official 和 pro-official NVFP4 配置添加了准确度基准数据(GSM8K 和 AIME25),但没有速度数据。
  5. 更新文档说明:在 docs/cookbook/autoregressive/DeepSeek/DeepSeek-V4.mdx 中,扩展了 NVFP4 部分,添加了官方检查点链接和 DSpark 算法使用指导,确保用户理解配置差异。
文件 模块 状态 重要度
docs/src/snippets/configs/deepseek-ai/deepseek-v4.jsx 配置文件 modified 6.3
docs/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx 配置文件 modified 4.94
docs/cookbook/autoregressive/DeepSeek/DeepSeek-V4.mdx 文档 modified 3.16

关键源码片段

docs/src/snippets/configs/deepseek-ai/deepseek-v4.jsx core-logic

主要配置文件,包含模型映射、命令行配置单元和 Docker 镜像映射的更新,是 PR 的核心变更。

以下片段展示了模型名称映射的更新和关键配置单元的新增:

  // 模型名称映射:为官方变体添加 NVFP4 路径
  modelNames: {
    "flash|fp4": "deepseek-ai/DeepSeek-V4-Flash",
    "flash|fp8": "deepseek-ai/DeepSeek-V4-Flash",
    "flash|nvfp4": "nvidia/DeepSeek-V4-Flash-NVFP4",
    "flash-official|fp4": "deepseek-ai/DeepSeek-V4-Flash-0731",
    "flash-official|nvfp4": "nvidia/DeepSeek-V4-Flash-0731-NVFP4", // 新增:官方 Flash NVFP4
    "flash-vision|fp4": "deepseek-ai/DeepSeek-V4-Flash-Vision-Exp",
    "pro|fp4": "deepseek-ai/DeepSeek-V4-Pro",
    "pro|fp8": "deepseek-ai/DeepSeek-V4-Pro",
    "pro|nvfp4": "nvidia/DeepSeek-V4-Pro-NVFP4",
    "pro-official|fp4": "deepseek-ai/DeepSeek-V4-Pro-0813",
    "pro-official|nvfp4": "nvidia/DeepSeek-V4-Pro-0813-NVFP4", // 新增:官方 Pro NVFP4
    // H200 FP8 需要特殊打包(Hopper 不能运行 FP4 混合 Instruct)
    "h200|flash|fp8": "sgl-project/DeepSeek-V4-Flash-FP8",
    "h200|pro|fp8": "sgl-project/DeepSeek-V4-Pro-FP8",
    // AMD FP8 使用 sgl-project 打包
    "mi300x|flash|fp8": "sgl-project/DeepSeek-V4-Flash-FP8",
    "mi355x|flash|fp8": "sgl-project/DeepSeek-V4-Flash-FP8",
    "mi355x|pro|fp8": "sgl-project/DeepSeek-V4-Pro-FP8",
  },  // Docker 镜像映射:NVFP4 检查点需要 nightly 镜像,因为 v0.5.18 有崩溃问题
  dockerImages: {
    // Flash Vision (Exp) 支持尚未发布,需要预览构建
    "flash-vision|fp4": "lmsysorg/sglang:dev-dsv4-flash-vision",
    // NVFP4 检查点在 v0.5.18 上崩溃(MXFP4 打包的 MTP 层的 FP8 委托需要 #36275 修复)
    "b200|nvfp4": "lmsysorg/sglang:dev",
    "b300|nvfp4": "lmsysorg/sglang:dev",
    "gb200|nvfp4": "lmsysorg/sglang:dev",
    "gb300|nvfp4": "lmsysorg/sglang:dev",
    h100: "lmsysorg/sglang:latest",
    // ... 其他硬件使用 latest
  },  // 配置单元示例:B200 + NVFP4 — 官方变体使用 DSPARK 算法
  {
    match: { hw: "b200", variant: "flash-official", quant: "nvfp4", strategy: "low-latency", nodes: "single" },
    verified: true, // 在 B200 上已验证
    env: [],
    flags: [
      "--trust-remote-code",
      "--model-path {{MODEL_NAME}}",
      "--tp 4",
      "--moe-runner-backend flashinfer_trtllm_routed",
      "--speculative-algorithm DSPARK", // 官方检查点捆绑 DSpark 草稿头
      "--disable-flashinfer-autotune",
      "--swa-full-tokens-ratio 0.1",
      "--host {{HOST_IP}}",
      "--port {{PORT}}",
    ],
  },
docs/src/snippets/configs/deepseek-ai/deepseek-v4-benchmarks.jsx core-logic

添加官方 NVFP4 变体的准确度基准数据,为用户提供性能参考。

以下片段展示了新增的准确度数据:

  // B200 + NVFP4 — 官方变体准确度数据(无速度数据)
  {
    match: { hw: "b200", variant: "flash-official", quant: "nvfp4", strategy: "low-latency", nodes: "single" },
    sglang_version: "dev@07c8f7294", // 基于开发版本
    accuracy: { gsm8k_pct: 96.82, aime25_pct: 98.96 }, // 新增准确度指标
  },
  {
    match: { hw: "b200", variant: "pro-official", quant: "nvfp4", strategy: "low-latency", nodes: "single" },
    sglang_version: "dev@07c8f7294",
    accuracy: { gsm8k_pct: 96.44, aime25_pct: 98.33 },
  },

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

主要风险是配置错误,但所有新配置单元都标记为未验证,且文档明确说明。Docker 镜像依赖 nightly 版本(lmsysorg/sglang:dev),可能引入不稳定性,但仅影响 NVFP4 部署场景。没有涉及核心引擎代码,回归风险低。

影响限于文档用户,帮助他们部署新的官方 NVFP4 检查点。提升文档完整性和用户体验,没有系统级影响。配置映射和命令行标志的更新使 cookbook 能够支持更多硬件组合。

配置未验证 依赖 nightly 镜像

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论