Prhub

#33157 [Docs] Add RTX 5090 DeepSeek-V4 recipe

原始 PR 作者 Fridge003 合并时间 2026-08-01 10:04 文件变更 1 提交数 4 评论 3 代码增减 +23 / -2

执行摘要

新增 RTX 5090 的 DeepSeek-V4 部署配置

PR body 明确提出要 'Expose a working DeepSeek-V4-Flash-0731 recipe for users serving the FP4 checkpoint on a single node with eight RTX 5090 GPUs'。RTX 5090 是 32GB 显存的 Blackwell 桌面消费卡,用户此前只能参考数据中心卡的 recipe,缺一个针对该硬件的 TP8 单节点配置;该 PR 补齐这一部署入口,并保持已验证与未验证状态的透明。

值得快速浏览,用于理解 cookbook 配置数据如何组织(硬件登记与部署 cell 分离、verified 状态语义、flags 的注入约定)。设计上可借鉴的是把硬件元数据作为配置而非引擎代码,以及用 Not Verified 状态透明区分未经基准验证的命令。无需深入精读,因为不涉及运行时逻辑。

讨论亮点

该 PR 没有人工 review 评论,zijiexia 直接 APPROVED。唯一有信息量的评论来自 mintlify[bot]:文档 preview 部署失败(🔴 Failed),未给出具体原因,作者在 CI 和自验证通过后自行合并;另外 gemini-code-assist[bot] 提示其消费者版审查服务已停用,无有效技术讨论。

实现拆解

变更集中在 docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx,按以下步骤展开:

  1. 硬件登记:在 supportedHardware 数组中加入 rtx5090 标识,并在模型专属 hardware 列表登记 RTX 5090(label RTX 5090、vram 32GB、vendor blackwell)。cookbook 引擎会把这份列表合并进共享的 HARDWARE_CATALOG,因此这是纯配置数据,不需要改引擎。
  2. 新增部署 cell:在 RTX 6000 相关 cell 之后插入一个匹配 hw: rtx5090variant: flash-officialquant: fp4strategy: low-latencynodes: single 的部署单元。命令使用 --tp 8(8 卡张量并行)、--moe-runner-backend flashinfer_mxfp4(FP4 走 FlashInfer MXFP4 MoE 后端)、--mem-fraction-static 0.90--cuda-graph-max-bs-decode 32verified 置为 false,对应页面的 Not Verified 状态。
  3. 配套校验:PR 使用 Node.js 断言检查硬件元数据、部署元组唯一性、Not Verified 状态和具体 flags,并跑 mint validatemint broken-links;由于是 cookbook 配置变更,没有运行时测试文件。
  4. 提交演进:从设计 recipe 到正式添加、再到 'chore: keep PR scoped to cookbook config' 主动收窄改动范围,最后合并 main,说明作者有意控制 PR 边界。
文件 模块 状态 重要度
docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx 文档配置 modified 5.64

关键源码片段

docs_new/src/snippets/configs/deepseek-ai/deepseek-v4.jsx configuration

唯一变更文件,承担 DeepSeek-V4 cookbook 全部配置数据:新增 RTX 5090 硬件登记和对应的 Flash Official / FP4 / low-latency 单节点部署 cell,直接决定文档页面生成的部署命令。

// DeepSeek-V4 cookbook 配置:新增 RTX 5090 硬件元数据
export const config = {
  modelName: "DeepSeek-V4",  // 共享 HARDWARE_CATALOG 之外的模型专属 GPU 登记,
  // RTX 5090 是 SM120 / Blackwell Desktop 消费卡,不是数据中心卡
  supportedHardware: [
    "h100", "h200", "b200", "b300", "gb200", "gb300",
    "rtx6000", "rtx5090",
    // AMD ROCm — MI300X (Flash FP8) + MI355X (Flash/Pro, FP4/FP8)
    "mi300x", "mi355x",
  ],  // 模型专属 GPU 定义:cookbook 引擎会合并进 HARDWARE_CATALOG
  hardware: [
    { id: "rtx6000", label: "RTX PRO 6000", vram: "96GB", vendor: "blackwell" },
    // 32GB 显存消费卡,8 卡合计 256GB,适合 FP4 284B 模型
    { id: "rtx5090", label: "RTX 5090", vram: "32GB", vendor: "blackwell" },
  ],
};// 新增部署 cell:Flash Official / FP4 / low-latency / 单节点 8 卡
// verified 为 false —— 命令在 8 卡 RTX 5090 devbox 手动验证过
// (BS=1、ISL=100000、OSL=1000),但未跑 benchmark,保持 Not Verified
{
  match: { hw: "rtx5090", variant: "flash-official", quant: "fp4", strategy: "low-latency", nodes: "single" },
  verified: false,
  env: [],
  flags: [
    "--trust-remote-code",
    "--model-path {{MODEL_NAME}}",
    "--tp 8", // 8 卡张量并行
    "--moe-runner-backend flashinfer_mxfp4", // FP4 走 FlashInfer MXFP4 MoE 后端
    "--mem-fraction-static 0.90", // 32GB 卡上预留 KV 缓存上限
    "--cuda-graph-max-bs-decode 32",
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
}

评论区精华

Mintlify 文档预览部署失败 other

mintlify[bot] 在 PR 评论中报告 preview 部署结果:Project lmsysorg 状态为 🔴 Failed,未给出具体失败原因,仅提示可启用 Workflows 自动生成 PR。

结论:预览失败未成为合并阻塞项,PR 在 CI 通过并获 zijiexia 批准后由作者合并;失败根因未在评论区披露,可能与文档站点配置或外部服务有关。 · unresolved

风险与影响

  • 命令未经 benchmark 验证:cell 标注 verified: false,用户可能误用未经验证的参数;PR body 明确说明仅在 8 卡 RTX 5090 devbox 上手动跑过 BS=1、ISL=100000、OSL=1000 的请求。
  • 内存参数敏感性:RTX 5090 仅 32GB 显存,--mem-fraction-static 0.90 在极端负载下可能触发 OOM,需要用户按实际负载调整。
  • 配置键耦合:新增 cell 依赖 modelNamesflash-official|fp4deepseek-ai/DeepSeek-V4-Flash-0731 的映射,该映射在 base 版本中已存在,但若未来重构配置结构,容易形成隐藏依赖。
  • 文档预览不可用:Mintlify preview 失败,PR 合入前无法在预览站点核对渲染效果。

对用户:RTX 5090 用户可以在 DeepSeek-V4 cookbook 页面直接生成可参考的 TP8 部署命令,降低配置成本;对系统:无运行时影响,只影响文档站点渲染和 cookbook 命令生成;对团队:新增一份配置数据,维护成本低,但需要注意 rtx5090 硬件标识与共享 HARDWARE_CATALOG 的合并逻辑保持一致。

未验证部署命令 配置数据耦合 Mintlify 预览失败

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论