执行摘要
为 MiniMax-M3 模型添加完整 cookbook 部署文档
MiniMax-M3 是一个约 428B 参数的多模态推理模型,需要为其在 SGLang 中的部署提供官方指导。本 PR 填补了这一文档空白,给出了完整的安装、启动命令生成和性能基准数据。
该 PR 为纯文档变更,值得阅读以了解新模型支持的完整流程和基准性能数据,但其本身无需要重点关注的设计决策。
审核记录为空,合并者直接批准。无公开讨论。
MiniMax-M3 是一个约 428B 参数的多模态推理模型,需要为其在 SGLang 中的部署提供官方指导。本 PR 填补了这一文档空白,给出了完整的安装、启动命令生成和性能基准数据。
该 PR 为纯文档变更,值得阅读以了解新模型支持的完整流程和基准性能数据,但其本身无需要重点关注的设计决策。
审核记录为空,合并者直接批准。无公开讨论。
docs_new/cookbook/autoregressive/MiniMax/MiniMax-M3.mdx:包含安装指南(Python/Docker切换)、Accordion、硬件选择器、命令生成面板和 Playground。页面依赖 _deployment.jsx 组件和两个配置文件。docs_new/src/snippets/configs/MiniMaxAI/minimax-m3.jsx:定义 config 对象,列出支持硬件(B200、B300、H200 等)、量化方式(MXFP8/BF16)、Docker 镜像映射、基准命令和 Playground 可调参数。docs_new/src/snippets/configs/MiniMaxAI/minimax-m3-benchmarks.jsx:包含 benchmarks 数组,记录各平台下的 TTFT、TPOT 和 GSM8K 准确性数据。docs_new/docs.json:在 MiniMax 组的 pages 数组开头加入新页面路径,使其在侧边栏显示。docs_new/cookbook/autoregressive/intro.mdx 将 MiniMax 卡片链接更新为新页面;MiniMax-M2.7.mdx 移除其 NEW 标签。| 文件 | 模块 | 状态 | 重要度 |
|---|---|---|---|
docs_new/cookbook/autoregressive/MiniMax/MiniMax-M3.mdx |
文档页面 | added | 6.79 |
docs_new/src/snippets/configs/MiniMaxAI/minimax-m3.jsx |
部署配置 | added | 7.81 |
docs_new/src/snippets/configs/MiniMaxAI/minimax-m3-benchmarks.jsx |
基准数据 | added | 7.02 |
docs_new/docs.json |
导航配置 | modified | 2.36 |
docs_new/cookbook/autoregressive/intro.mdx |
概览页面 | modified | 2.31 |
docs_new/cookbook/autoregressive/MiniMax/MiniMax-M2.7.mdx |
旧页面 | modified | 2.17 |
docs_new/cookbook/autoregressive/MiniMax/MiniMax-M3.mdx
core-logic
核心文档页面,完整介绍 MiniMax-M3 的部署步骤和特性。
// MiniMax-M3.mdx - 主文档页关键导入与组件使用
import { Deployment } from "/src/snippets/_deployment.jsx";
import { config } from "/src/snippets/configs/MiniMaxAI/minimax-m3.jsx";
import { benchmarks } from "/src/snippets/configs/MiniMaxAI/minimax-m3-benchmarks.jsx";
// 部署面板:根据用户选择的硬件、量化、策略等生成启动命令
<Deployment config={config} benchmarks={benchmarks} />
// Playground:允许用户调整更多参数(TP、CP、MoE 后端等)
// 其配置来自 config.playgroundFeatures
docs_new/src/snippets/configs/MiniMaxAI/minimax-m3.jsx
core-logic
部署配置的核心文件,定义模型名称、硬件支持、量化、Docker 镜像映射、基准命令和 Playground 参数。
// minimax-m3.jsx - MiniMax-M3 部署配置
// 被 _deployment.jsx 和 _playground.jsx 使用
export const config = {
modelName: "MiniMax-M3",
// 支持硬件列表(已验证或推断支持)
supportedHardware: [
"b200", "b300", "gb200", "gb300", // NVIDIA Blackwell
"mi300x", "mi325x", "mi350x", "mi355x", // AMD Instinct
"h200", // NVIDIA Hopper
],
variants: [{ id: "default", label: "Default" }],
quantizations: [
{ id: "mxfp8", label: "MXFP8" }, // 原生 MXFP8,Blackwell 与 MI355X 支持
{ id: "bf16", label: "BF16" }, // BF16 回退,Hopper 使用
],
// 硬件到 Docker 镜像的映射
dockerImages: {
b200: "lmsysorg/sglang:dev-minimax-m3",
b300: "lmsysorg/sglang:dev-cu13-minimax-m3",
gb200: "lmsysorg/sglang:dev-cu13-minimax-m3",
gb300: "lmsysorg/sglang:dev-cu13-minimax-m3",
h200: "lmsysorg/sglang:dev-cu12-minimax-m3",
mi300x: "lmsysorg/sglang:<rocm-tag>-rocm700-mi30x",
mi355x: "lmsysorg/sglang:<rocm-tag>-rocm720-mi35x",
},
// Playground 中可调整的 MoE 并行选项
playgroundFeatures: {
moe: {
backend: {
options: [
{ id: null, label: "Inherited" },
{ id: "deepep", label: "DeepEP", flags: ["--moe-a2a-backend deepep"] },
],
},
ep: { label: "EP", values: [null, 2, 4, 8] },
},
attention: { knobs: [ { id: "tp", label: "TP", values: [null, 1, 2, 4, 8] } ] },
},
// 基准命令模板(bench_serving 和 sgl-eval)
benchmarkCommands: {
speed: `python3 -m sglang.bench_serving --backend sglang --host {{CURL_HOST}} --port {{CURL_PORT}} --model {{MODEL_NAME}} --dataset-name {{DATASET}} --random-input-len {{ISL}} --random-output-len {{OSL}} --num-prompts {{NUM_PROMPTS}} --max-concurrency {{MAX_CONCURRENCY}}`,
accuracy: {
gsm8k_pct: `pip install git+https://github.com/sgl-project/sgl-eval\nsgl-eval run gsm8k --base-url http://{{CURL_HOST}}:{{CURL_PORT}}/v1 --model {{MODEL_NAME}} --temperature 1.0 --top-p 0.95 --thinking`,
},
},
};
docs_new/src/snippets/configs/MiniMaxAI/minimax-m3-benchmarks.jsx
core-logic
提供各硬件平台下的性能基准数据和 GSM8K 准确性结果。
// minimax-m3-benchmarks.jsx - MiniMax-M3 各平台性能基准数据
// 每个对象通过 match 字段与部署配置单元格对应
export const benchmarks = [
{
// Blackwell B200, MXFP8, tp4, MSA 路径
match: { hw: "b200", variant: "default", quant: "mxfp8", strategy: "balanced", nodes: "single" },
sglang_version: "PR #27944",
speed: [{ workload: { dataset: "random", isl: 2048, osl: 256, max_concurrency: 64, num_prompts: 128 },
ttft_ms: 2410, tpot_ms: 148.4, tokens_per_sec_per_gpu: 124 }],
accuracy: { gsm8k_pct: 94.4 }, // sgl-eval --thinking, 全量 1319 题 , 推荐采样参数
},
{
// Hopper H200, BF16, tp8, 内置 Triton 稀疏路径
match: { hw: "h200", variant: "default", quant: "bf16", strategy: "balanced", nodes: "single" },
sglang_version: "PR #27944",
speed: [{ workload: { dataset: "random", isl: 2048, osl: 256, max_concurrency: 64, num_prompts: 128 },
ttft_ms: 1068, tpot_ms: 78.0, tokens_per_sec_per_gpu: 105 }],
accuracy: { gsm8k_pct: 97.0 }, // sgl-eval --thinking, 全量 1319 题
},
// ... 其他平台(B300/GB300/MI355X)数据类似
];
当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。
该 PR 为纯文档变更,风险极低。需注意:
1) 基准测试数据引用自 PR #27944,若后续模型支持有变化可能需要同步更新;
2) 导航配置中的路径必须与实际文件一致,否则会导致页面 404;
3) Docker 镜像标签含有占位符 <rocm-tag>,需用户自行替换。
用户:获得 MiniMax-M3 的完整部署指导,降低使用门槛。系统:无运行时影响。团队:统一了文档结构,便于后续维护和扩展。
当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。
参与讨论