Prhub

#32834 [docs] Kimi-K3: widen the H200 High-Throughput recipe to 4x8 TP32/EP32

原始 PR 作者 zijiexia 合并时间 2026-07-30 08:18 文件变更 2 提交数 1 评论 3 代码增减 +24 / -12

执行摘要

修正 Kimi-K3 H200 吞吐配方为 4×8 TP32/EP32

PR body 明确指出:Kimi-K3 cookbook 中 H200 Unified High-Throughput 单元格是 Balanced(2×8 TP16/EP16)的复制品,仅修改了 --mem-fraction-static 0.90extra_buffer_lazy,而实际运行的操作点是跨 4 节点的 TP32/EP32,因此页面提供了无人使用的配方。

作为纯文档修复,建议合并。无需精读,但可关注其数据驱动的配置校正方式(基于实际运行结果更新文档)。

讨论亮点

该 PR 没有引发讨论。审核者 wisclmy0611 直接批准。Mintlify 预览部署机器人自动发布了预览链接。

实现拆解

  1. 更新 docs_new/src/snippets/configs/moonshotai/kimi-k3.jsx 中的 H200 High-Throughput 单元格(约第 1008-1042 行):
    • nnodes: 2 改为 4--tp-size--ep-size16 改为 32
    • env 中添加跨节点网络环境变量: SGLANG_HOST_IP={{LOCAL_IP}}NCCL_SOCKET_IFNAME={{NETWORK_IFACE}}GLOO_SOCKET_IFNAME={{NETWORK_IFACE}}
    • 添加性能调优环境变量: PYTORCH_CUDA_ALLOC_CONF=expandable_segments:TrueSGLANG_K3_ATTN_RES_MODE=jitSGLANG_MOE_FUSED_GATE_RADIX=1
    • flags 中添加 --dist-timeout 3600
    • 更新注释,记录实际运行的静态分配结果(每 GPU 12.54 GB 空闲,1940352 KV tokens)。
  2. 更新 docs_new/cookbook/autoregressive/Moonshotai/Kimi-K3.mdx 中的三处文本:硬件食谱行、Strategy 列表、平台表格中的 H200 行,以反映 H200 High-Throughput 是 4×8 TP32/EP32。
  3. 更新 JSX 文件顶部的注释和节点数固定说明,指出 H200 在 Unified High-Throughput 下为 4×8。
文件 模块 状态 重要度
docs_new/src/snippets/configs/moonshotai/kimi-k3.jsx 文档片段 modified 6.1
docs_new/cookbook/autoregressive/Moonshotai/Kimi-K3.mdx 文档正文 modified 2.84

关键源码片段

docs_new/src/snippets/configs/moonshotai/kimi-k3.jsx core-logic

核心变更文件:修复 H200 High-Throughput 单元格的节点数、TP/EP 大小、添加跨节点网络环境变量和性能调优参数。

{
  // The one H200 cell that widens past a single pair of nodes. As run — with
  // DSPARK and HiCache L1+L2 layered on, at ratio 0.058 — the static
  // allocation leaves 12.54 GB free per GPU and 1940352 KV tokens.
  match: { hw: "h200", pdMode: "unified", strategy: "high-throughput" },
  nnodes: 4, // 从 2 改为 4,对应跨 4 节点部署
  verified: false,
  verificationStatus: "in-progress",
  env: [
    "NCCL_MNNVL_ENABLE=1",
    "NCCL_CUMEM_ENABLE=1",
    "PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True", // 新增:启用 expandable segments 避免内存碎片
    "SGLANG_ENABLE_TP_MEMORY_INBALANCE_CHECK=0",
    "SGLANG_K3_ATTN_RES_MODE=jit", // 新增:K3 attention residual 模式设为 JIT
    "SGLANG_MOE_FUSED_GATE_RADIX=1", // 新增:MoE fused gate radix 设为 1
    "SGLANG_HOST_IP={{LOCAL_IP}}", // 新增:跨节点通信必需的本机 IP
    "NCCL_SOCKET_IFNAME={{NETWORK_IFACE}}", // 新增:指定 NCCL 使用的网络接口
    "GLOO_SOCKET_IFNAME={{NETWORK_IFACE}}", // 新增:指定 Gloo 使用的网络接口
  ],
  flags: [
    "--trust-remote-code",
    "--model-path {{MODEL_NAME}}",
    "--tp-size 32", // 从 16 改为 32
    "--ep-size 32", // 从 16 改为 32
    "--moe-runner-backend marlin",
    "--decode-attention-backend flashmla",
    "--enable-symm-mem",
    "--mem-fraction-static 0.90",
    "--mamba-radix-cache-strategy extra_buffer_lazy",
    "--dist-timeout 3600", // 新增:分布式超时设为 1 小时,适应跨节点启动
    "--reasoning-parser kimi_k3",
    "--tool-call-parser kimi_k3",
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
},

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

纯文档变更,无运行时代码修改,风险极低。唯一潜在风险是配置文本错误导致用户误用,但 PR 基于实际运行验证,且已验证 mint validate 通过和本地渲染正确。

影响范围限定在 Kimi-K3 cookbook 文档的 H200 部分。用户将看到正确的 High-Throughput 配方(4×8 TP32/EP32),避免部署 2×8 错误配置。其他硬件(B200、H100 等)和策略(Low-Latency、Balanced)不受影响。

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论