Prhub

#32592 docs(cookbook): update Kimi-K3 GB200 recipes from measured 4x4 runs

原始 PR 作者 YAMY1234 合并时间 2026-07-29 07:26 文件变更 1 提交数 3 评论 4 代码增减 +110 / -4

执行摘要

用实测数据更新 Kimi-K3 在 GB200 上的部署配置

Kimi-K3 的 GB200 配置之前是从 GB300 配方转录的,未经实测。本 PR 用实际测量结果替换了之前的估算,并填补了缺失的 prefill cell 和 multiNodeHints,确保用户能够基于可靠数据部署。

建议部署 Kimi-K3 在 GB200 上的团队精读此 PR,特别是 prefill 拓扑选择和 decode 并行配置的权衡分析。注释中包含了多维度性能对比,可作为手动调优的参考。其他硬件平台无关。

讨论亮点

Review 中 kpham-sgl 询问是否包含 GSM8K 或 AIME26 验证结果,否则应保持 false。YAMY1234 回应已标记为 false 并解决了冲突。讨论确认了这些配置尚未经过精度验证,但针对性能测量提供了可信数据。

实现拆解

实现拆解:

  1. 新增 prefill cell:在 kimi-k3.jsx 中添加了两个 GB200 prefill 配置(default 和 long-context)。Default cell 采用 TP1 × PP16 拓扑,根据实测在并发 32 时 prefill tok/s/GPU 比 PP8 × TP2 高 26%。Long-context cell 将 mem-fraction-static 提升至 0.90,保持 TP=1 以最大化 KV 容量。
  2. 更新 decode cell:基于四种拓扑的对比数据调整了配置。Low-latency 从 tp16 改为 tp8 pp2,以满足 decode pp_size 与 prefill pp_size 一致或为 1 的约束。Balanced 添加了 ep16,实测显示 EP16 在 DCP16 基础上提升 throughput 6-10%。High-throughput 将 DCP16 改为 dcp8 dp2 ep16,以利用 MegaMoE 在 dp>1 时的优势。
  3. 添加 multiNodeHints:新增 multiNodeHints.gb200 条目,包含 MNNVL 环境变量、NVL72 域和 JIT 缓存路径等设置。
  4. 补充性能注释:在每个 cell 中添加了详细的性能说明和权衡解释,例如 prefill 在低并发时推荐 TEP16,decode 在不同并发区的领先策略等。
  5. 验证状态保持:所有 GB200 cell 仍标记为 verified: falseverificationStatus: "in-progress",因为 GSM8K 精度验证尚未完成。
文件 模块 状态 重要度
docs_new/src/snippets/configs/moonshotai/kimi-k3.jsx 文档配置 modified 6.85

关键源码片段

docs_new/src/snippets/configs/moonshotai/kimi-k3.jsx core-logic

唯一变更文件,包含了所有 GB200 配置的更新和新增,是 PR 的核心。

// GB200 prefill default cell: PP16 x TP1 spans all 16 ranks.
// Prefill tok/s/GPU at ISL 8192, concurrency 32: 4550 here vs 3596 (PP8 x TP2),
// 2407 (TEP16), 1652 (TP16); flat past 32. Below concurrency ~8 the pipeline
// cannot fill and TEP16 leads instead (1947 vs 1227).
match: { hw: "gb200", pdMode: "prefill", strategy: "default" },
nnodes: 4,
verified: false,
verificationStatus: "in-progress",
env: [
  "SGLANG_ENABLE_TP_MEMORY_INBALANCE_CHECK=0",
],
flags: [
  "--trust-remote-code",
  "--model-path {{MODEL_NAME}}",
  "--tp-size 1",
  "--pp-size 16",
  "--mem-fraction-static 0.85",
  "--chunked-prefill-size 16384",
  "--max-prefill-tokens 16384",
  "--disable-flashinfer-autotune",
  "--weight-loader-prefetch-checkpoints",
  "--reasoning-parser kimi_k3",
  "--tool-call-parser kimi_k3",
  "--disaggregation-mode prefill",
  "--disaggregation-transfer-backend nixl",
  "--disaggregation-bootstrap-port 8998",
  "--host {{HOST_IP}}",
  "--port {{PORT}}",
],

评论区精华

GSM8K/AIME26 验证结果 测试

kpham-sgl 询问是否包含 GSM8K 或 AIME26 结果,否则应保持 false。YAMY1234 回应已标记为 false 并解决冲突。

结论:配置未经验证精度,保留 verified: false 状态。 · 已解决

风险与影响

主要风险在于配置未经验证(verified: false),用户若直接用于生产可能遇到精度问题。但配置均基于实测性能数据,且性能比较与 accuracy-neutral 验证(GSM8K 0.974-0.976)在 PR 中已呈现。此外,multiNodeHints 中的路径可能需根据实际环境调整。风险较低。

影响范围仅限于使用 GB200 部署 Kimi-K3 的用户。更新提供了经过性能基准测试的配置参数,能帮助用户更快找到最优部署拓扑,减少手动调优成本。对系统其他模块无影响。

缺少基准验证 配置未经验证

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论