Prhub

#31918 [Cookbook] Add Laguna-S-2.1

原始 PR 作者 Jiminator 合并时间 2026-07-22 01:01 文件变更 7 提交数 20 评论 5 代码增减 +970 / -3

执行摘要

新增 Laguna-S-2.1 模型 cookbook 文档

为 SGLang 用户提供官方 cookbook,指导部署 poolside/Laguna-S-2.1 模型。PR body 中列出验证条件:mint validate 通过、单元格渲染正确、URL-hash 导航持久化、NEW 标签仅在新页面显示、首页卡片链接指向新页面。

值得快速浏览以了解 SGLang cookbook 的文档结构和配置模型的方法。团队可参考 laguna-s21.jsx 的配置模式来添加其他模型,注意保持验证状态、版本号和数字的一致性。

讨论亮点

机器人审查发现两处不一致

  • NVFP4 验证状态:配置文件中标记 verified: false 并注删除线,但基准文件已标记 verified: true 并包含具体数值。
  • Docker 镜像标签:安装指导使用 dev,配置 H200 单元格使用 latest
    作者 Jiminator 回复:均已修复,NVFP4 在 B300/GB300 上通过 stock sglang 0.5.15 验证,镜像统一为 latest

实现拆解

  1. 新增模型配置laguna-s21.jsx 定义 config 对象,声明支持的硬件、量化、策略、模型名称映射、占位符、benchmark 命令、Playground 选项及 30 多个部署单元格(每个单元格匹配特定硬件/量化/策略/节点组合,包含环境变量和启动参数)。
  2. 新增基准数据laguna-s21-benchmarks.jsx 定义 benchmarks 数组,记录 H200/B300/GB300 在各量化下的 TTFT/TPOT/tokens_per_sec 速度数据和 GSM8K/AIME25 准确率,并标注验证状态和 SGLang 版本。
  3. 新增 MDX 页面Laguna-S-2.1.mdx 引入上述配置和基准,渲染 Deployment 组件和 Playground 组件;包含安装步骤(pip/docker)、模型介绍、关键特性、Configuration Tips 等。
  4. 更新导航:在 docs.json 的 Poolside 分组中加入新页面路径,并调整顺序使其排在首位。
  5. 更新首页入口intro.mdx 中 Poolside 卡片链接由 Laguna-XS-2.1 改为 Laguna-S-2.1。
  6. 清理旧标签:从 Laguna-M.1.mdxLaguna-XS-2.1.mdx 移除 tag: NEW(仅新页面保留)。
文件 模块 状态 重要度
docs_new/src/snippets/configs/poolside/laguna-s21.jsx 文档配置 added 7.07
docs_new/src/snippets/configs/poolside/laguna-s21-benchmarks.jsx 基准数据 added 6.95
docs_new/cookbook/autoregressive/Poolside/Laguna-S-2.1.mdx 部署页面 added 5.62
docs_new/docs.json 导航配置 modified 2.36
docs_new/cookbook/autoregressive/intro.mdx 首页入口 modified 2.31
docs_new/cookbook/autoregressive/Poolside/Laguna-M.1.mdx 旧页面清理 modified 1.77
docs_new/cookbook/autoregressive/Poolside/Laguna-XS-2.1.mdx 旧页面清理 modified 1.77

关键源码片段

docs_new/src/snippets/configs/poolside/laguna-s21-benchmarks.jsx core-logic

提供经过验证的速度和准确率基准数据,是用户选型的重要参考。

// laguna-s21-benchmarks.jsx — 基准测量数据
// 包含 H200/B300/GB300 在各量化下的速度(TTFT/TPOT)和准确率(GSM8K/AIME25)export const benchmarks = [  // ── H200 (8×H200, tp 8, sglang 0.5.15.post1) ──
  // 速度数据:random ISL=8192/OSL=1024,bench_serving 测量
  // tokens_per_sec_per_gpu 为每个 GPU 的吞吐  // BF16 高吞吐:ttft 23.7s,tpot 256.8ms,吞吐 5264 tok/s/GPU
  {
    match: { hw: "h200", variant: "default", quant: "bf16", strategy: "high-throughput", nodes: "single" },
    verified: true,
    sglang_version: "0.5.15.post1",
    speed: [
      { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1024 },
        ttft_ms: 23742, tpot_ms: 256.8, tokens_per_sec_per_gpu: 5264 },
    ],
    // AIME25 为 null 因为 BF16 推理长度超 max_tokens=64000 导致无效
    accuracy: { gsm8k_pct: 93.18, aime25_pct: null },
  },  // BF16 低延迟(concurrency=1 和 16 两个点)
  {
    match: { hw: "h200", variant: "default", quant: "bf16", strategy: "low-latency", nodes: "single" },
    verified: true,
    sglang_version: "0.5.15.post1",
    speed: [
      { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 1 },
        ttft_ms: 102.3, tpot_ms: 3.48, tokens_per_sec_per_gpu: 305 },
      { workload: { dataset: "random", isl: 8192, osl: 1024, max_concurrency: 16 },
        ttft_ms: 97.7, tpot_ms: 6.45, tokens_per_sec_per_gpu: 2094 },
    ],
    accuracy: { gsm8k_pct: 93.33, aime25_pct: null },
  },  // ... 更多硬件 / 量化组合的条目
];

评论区精华

NVFP4 验证状态不一致 正确性

机器人指出配置文件中 NVFP4 单元格标记 verified 为 false,但基准文件标记 verified 为 true 且包含数值,MDX 中也提及“未验证”,三者矛盾。

结论:作者回复已修复:NVFP4 在 stock sglang 0.5.15 上验证通过,所有文件对齐为 verified: true 并删除矛盾注释。 · 已解决

Docker 镜像标签不一致 documentation

机器人发现 MDX 安装指导使用 lmsysorg/sglang:dev,但 H200 配置单元格使用 lmsysorg/sglang:latest,可能造成用户版本不匹配。

结论:作者回复已修复:统一使用 latest 标签。 · 已解决

风险与影响

纯文档变更,无运行时风险。但 benchmark 数据依赖特定 SGLang 版本(0.5.15.post1),版本升级后数值可能失效;启动命令中的 --mem-fraction-static 等参数若后续后端行为变化可能误导用户。无测试覆盖(cookbook 不要求 CI 验证),主要依赖人工 review。

用户:获得即开即用的 Laguna-S-2.1 单节点部署命令和参考性能数据,降低模型使用门槛。系统:无影响。团队:完善了 Poolside 系列 cookbook 覆盖,体现了 SGLang 对大型 MoE 模型的支持。影响范围限于文档目录,影响程度低。

基准数值依赖版本 文档无自动验证

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论