Prhub

#28664 [Cookbook] Laguna-M.1: enable FP8 on Blackwell + drop provisional AIME numbers

原始 PR 作者 Jiminator 合并时间 2026-06-19 00:23 文件变更 3 提交数 1 评论 1 代码增减 +119 / -64

执行摘要

Laguna-M.1: 启用 Blackwell FP8 并移除 AIME 25 数据

原 cookbook 页面将 FP8 限制在 Hopper,因为 Blackwell 上 compressed-tensors block-FP8 权重缩放因子不是 UE8M0 格式,导致 DeepGEMM 产生 NaN 输出。PR #28662 正在修复根本原因,本 PR 先通过 Triton 后端作为临时工作区启用 FP8。同时,AIME 25 数据因 max-tokens 截断导致分数偏低,暂移除以保持数据准确性。

建议使用 Blackwell + FP8 的用户精读本 PR 的注释和配置说明,特别是临时 flag 的用法。同时关注 #28662 的进展,以移除 workaround。AIME 数据移除是合理的短期决策。

讨论亮点

PR 获得直接批准,无实质讨论。PR body 明确记录了 DeepGEMM UE8M0 问题和使用 Triton 临时后端的决策。

实现拆解

  1. 修改 laguna-m1.jsx:更新硬件注释,增加 Blackwell FP8 的支持说明;在 accuracy 部分移除 AIME 25 命令;调整 defaultAccuracyaccuracyLabels 以移除 AIME 25 键。
  2. 修改 laguna-m1-benchmarks.jsx:添加 B200 FP8 的 benchmark 条目(GSM8K 93.78%),移除所有 aime25_pct 字段,更新注释反映新数据源和已知限制。
  3. 修改 Laguna-M.1.mdx:更新 FP8 tips 段落,明确指出 Blackwell 上需加 --fp8-gemm-backend triton,并链接到 #28662。
文件 模块 状态 重要度
docs_new/src/snippets/configs/poolside/laguna-m1.jsx 文档配置 modified 6.86
docs_new/src/snippets/configs/poolside/laguna-m1-benchmarks.jsx 基准数据 modified 6.34
docs_new/cookbook/autoregressive/Poolside/Laguna-M.1.mdx 文档页面 modified 2.54

关键源码片段

docs_new/src/snippets/configs/poolside/laguna-m1.jsx core-logic

核心配置文件,定义硬件支持、量化组合、基准命令和精度标签。本 PR 扩展了 Blackwell FP8 支持注释,移除了 AIME 25 相关配置。

// 来自 laguna-m1.jsx,展示关键配置变更
// Hardware: H200 (Hopper) + B200/B300/GB200/GB300 (Blackwell).
// - BF16 runs everywhere.
// - FP8 runs everywhere. On Blackwell (sm_100) the compressed-tensors block-FP8 weight scales
// aren't UE8M0-packed, so the default DeepGEMM path produces garbage → the Blackwell FP8 cells
// add `--fp8-gemm-backend triton` (correct, ~19% slower than DeepGEMM). Temporary until the
// ue8m0-requant fix (PR #28662) lands; H200 FP8 (Hopper) is unaffected and needs no flag.
// - NVFP4 is Blackwell-only.
// Cells: H200×{BF16,FP8}; each Blackwell×{BF16,FP8,NVFP4}.export const config = {
  modelName: "Laguna-M.1",
  supportedHardware: ["h200", "b200", "b300", "gb200", "gb300"],
  variants: [ { id: "default", label: "Default" } ],
  quantizations: [
    { id: "bf16", label: "BF16" },
    { id: "fp8", label: "FP8" },
    { id: "nvfp4", label: "NVFP4" },
  ],
  strategies: [ { id: "balanced", label: "Balanced" } ],
  nodesOptions: [ { id: "single", label: "Single Node" } ],
  modelNames: {
    "default|bf16": "poolside/Laguna-M.1",
    "default|fp8": "poolside/Laguna-M.1-FP8",
    "default|nvfp4": "poolside/Laguna-M.1-NVFP4",
  },
  // accuracy 部分:只保留 GSM8K,移除 AIME 25
  defaultAccuracy: {
    default: { gsm8k_pct: null },
  },
  accuracyLabels: [
    ["gsm8k_pct", "GSM8K", "%"],
  ],
};
docs_new/src/snippets/configs/poolside/laguna-m1-benchmarks.jsx core-logic

基准数据文件,包含各硬件 + 量化组合的实测精度和性能数据。本 PR 添加了 B200 FP8 条目,移除了所有 AIME 25 数据。

// 来自 laguna-m1-benchmarks.jsx,展示新增的 B200 FP8 条目
// 所有数据均为实际测量值,精度轴仅 GSM8K(AIME 25 将在无截断数据时重新加入)
export const benchmarks = [
  // ===== H200 — BF16 / FP8 =====
  { match: { hw: "h200", variant: "default", quant: "bf16", strategy: "balanced", nodes: "single" },
    verified: true, sglang_version: "main @ 3f668733 (#28400 + #28604)", accuracy: { gsm8k_pct: 93.02 } },
  { match: { hw: "h200", variant: "default", quant: "fp8", strategy: "balanced", nodes: "single" },
    verified: true, sglang_version: "main @ 3f668733 (#28400 + #28604 + g_proj FP8 fix #28649)", accuracy: { gsm8k_pct: 93.25 } },
  // ===== B200 — BF16 / FP8 / NVFP4 =====
  { match: { hw: "b200", variant: "default", quant: "bf16", strategy: "balanced", nodes: "single" },
    verified: true, sglang_version: "PR #28400 + #28604", accuracy: { gsm8k_pct: 91.88 } },
  { // ✅ REAL — B200 FP8, with --fp8-gemm-backend triton
    match: { hw: "b200", variant: "default", quant: "fp8", strategy: "balanced", nodes: "single" },
    verified: true,
    sglang_version: "main + #28649 + --fp8-gemm-backend triton (DeepGEMM UE8M0 workaround; fix = PR #28662)",
    accuracy: { gsm8k_pct: 93.78 } },
  { match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "balanced", nodes: "single" },
    verified: true, sglang_version: "PR #28400 + #28604", accuracy: { gsm8k_pct: 89.38 } },
  // ===== 其他 Blackwell 硬件为待定桩 =====
  { match: { hw: "b300", variant: "default", quant: "fp8", strategy: "balanced", nodes: "single" } },
  { match: { hw: "gb200", variant: "default", quant: "fp8", strategy: "balanced", nodes: "single" } },
  { match: { hw: "gb300", variant: "default", quant: "fp8", strategy: "balanced", nodes: "single" } },
];

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  1. 依赖未修复的 #28662:若 #28662 长期未合入,本 PR 的临时 flag 将成为永久性配置,且用户可能忽略导致空输出。
  2. 性能回退:Triton 后端比 DeepGEMM 慢约 19%,可能影响吞吐。
  3. 文档过时风险:#28662 合并后 flag 可移除,需及时更新 cookbook。
  4. AIME 数据移除可能导致部分用户对推理能力评估不满。

用户:Blackwell 用户现可运行 FP8 推理,但需手动添加额外 flag。H200 用户无影响。AIME 数据不再展示,用户需自行测量。系统:无运行时变更,仅文档和基准数据更新。团队:需追踪 #28662 进度并回访更新。整体影响中等,主要面向特定硬件用户。

依赖 #28662 修复 文档可能过时 临时性能回退 (~19%)

关联 Issue

#28662 [Fix] compressed-tensors block FP8: requantize weight scales to UE8M0 for DeepGEMM on Blackwell

完整报告

参与讨论