执行摘要
本PR根据内部反馈清理了GLM-5.2和MiniMax-M3 cookbook中的冗余serve flags,删除手动设置的运行时默认值已正确的参数,提高--max-running-requests避免人为限流;同时用真实权重重新测量B200/GB300的benchmark性能并更新文档。整体降低了cookbook配置的维护成本,提高了配置的可读性和准确性。
功能与动机
Lianmin在2026年6月19日的反馈指出:“make the default arguments just work — drop hand-set serve flags where the runtime default is correct or better”。因此本PR删除了GLM-5.2配置中与运行时默认重复的--cuda-graph-max-bs-decode等标志,并调整了--max-running-requests以允许更高的并发。同时,上游PR#28976已实现--attention-backend fa4时自动强制page_size为128,因此MiniMax-M3文档中要求显式设置--page-size 128的说明已过时,需修正。
实现拆解
-
清理GLM-5.2 serve flags:在glm-5.2.jsx中,删除所有cell中的--cuda-graph-max-bs-decode标志,低延迟和高吞吐策略不再显式设置--max-running-requests,平衡策略提升至256。为GB300高吞吐配置添加SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK=512环境变量。向GLM-5.2.mdx添加benchmark方法论注释。
-
修复MiniMax-M3 page-size注释:在minimax-m3.jsx中删除所有Blackwell cell的--page-size 128,并在MiniMax-M3.mdx中修正说明,指出--attention-backend fa4已自动强制page_size为128。
-
更新benchmark数据:在glm-5.2-benchmarks.jsx中,用main @ 09ca4fc上真实权重的测量结果替换旧数据。H200标记为待重新测量,B200和GB300填入新结果。
docs_new/src/snippets/configs/zai-org/glm-5.2.jsx
核心serve flags清理:删除冗余的 --cuda-graph-max-bs-decode,调整 --max-running-requests,为GB300 HT添加 env SGLANG_DEEPEP_NUM_MAX_DISPATCH_TOKENS_PER_RANK=512
// GLM-5.2 balanced cell (H200 FP8): 去掉 --cuda-graph-max-bs-decode 128,
// 同时将 --max-running-requests 从 80 提升到 256,避免人为限流。
{
match: { hw: "h200", variant: "default", quant: "fp8", strategy: "balanced", nodes: "single" },
verified: true,
env: [],
flags: [
"--model-path {{MODEL_NAME}}",
"--tp 8",
"--dp 8",
"--enable-dp-attention",
"--moe-a2a-backend deepep",
"--speculative-algorithm EAGLE",
"--speculative-num-steps 1",
"--speculative-eagle-topk 1",
"--speculative-num-draft-tokens 2",
"--mem-fraction-static 0.85",
// 大 chunked-prefill 是 balanced 策略的主要杠杆;
// max-running 跟踪 KV 容量(H200 上约 60-80 个 8K+1K 请求)。
"--chunked-prefill-size 32768",
"--max-running-requests 256",
"--host {{HOST_IP}}",
"--port {{PORT}}",
],
}
docs_new/src/snippets/configs/zai-org/glm-5.2-benchmarks.jsx
核心benchmark数据更新,用真实权重重新测量B200/GB300,标记H200为pending
// B200 low-latency 策略的新 benchmark 条目
// 测量条件:8×B200, TP8, 真实权重 , --random-range-ratio 1.0, 每次运行 --flush-cache
// env SGLANG_SIMULATE_ACC_LEN=3.5 固定 EAGLE 接受长度(50% 接受 3/50% 接受 4)
{
match: { hw: "b200", variant: "default", quant: "fp8", strategy: "low-latency", nodes: "single" },
sglang_version: "main @ 09ca4fc",
speed: [
{ workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1 },
ttft_ms: 757, tpot_ms: 3.22, tokens_per_sec_per_gpu: 32 },
{ workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 16 },
ttft_ms: 3188, tpot_ms: 9.12, tokens_per_sec_per_gpu: 164 },
],
}
评论区精华
本PR无实质性review讨论。zijiexia直接批准了变更,机器人评论未提出建设性意见。
风险与影响
- 风险:删除的flags可能影响少量已习惯旧配置的用户,但PR通过验证确认运行时默认值表现更好。GB300高吞吐配置的env变量是必需的,用户若忽略可能导致DeepEP断言失败。benchmark数据更新可能使用户对比旧版本时产生困惑,但已注明测量条件。
- 影响:cookbook用户获得更简洁的命令,维护团队减少了冗余配置。无运行时影响。
关联脉络
本PR是cookbook配置持续优化的一部分。上游PR#28976(fa4页面大小自动强制)使MiniMax-M3的显式设置不再必要。后续可关注其他模型配置的类似清理。
参与讨论