Prhub

#36204 docs: mark Ling-3.0-flash DSPARK verified for all four quantizations on H200

原始 PR 作者 JustinTong0323 合并时间 2026-08-25 02:05 文件变更 3 提交数 1 评论 1 代码增减 +56 / -2

执行摘要

标记 Ling-3.0-flash DSPARK 在 H200 上四种量化验证通过。

此前 DSPARK 仅在 BF16(4xB200)上验证通过,其他量化方案缺乏确认,导致用户无法放心使用。为了建立用户对 DSPARK 在此模型上跨硬件与量化方案稳定性的信心,作者在 4xH200 上补齐了 BF16、FP8、INT4、MXFP4 的完整 GSM8K 验证,并在部署面板中标记这些配置为已验证。PR 描述明确指出:'This marks the remaining quantizations verified on 4xH200'。

值得快速浏览,了解 DSPARK 在 H200 上的验证状态与配置要点,特别是 MXFP4 的 --moe-runner-backend flashinfer_mxfp4 要求。可关注 PR #33561 的合并进度,确保文档中引用的 commit 仍然有效。

讨论亮点

PR 无 review 评论,仅有一条 issue 评论来自 yuan-luo:'Shall we move forward https://github.com/sgl-project/sglang/pull/33561 ?',表明此 PR 依赖 PR #33561,且该 PR 可能尚未合并,需要推进。

实现拆解

  1. ling-3.0-flash.jsx 重构:引入 DSPARK_VERIFIED 集合(new Set(["b200|bf16", "h200|bf16", "h200|fp8"])),替代原先 c.match.hw === "b200" && c.match.quant === "bf16" 的硬编码判断,使 dsparkTwinverified 状态由集合驱动,便于后续扩展。同时新增两个直接列出的 H200 low-latency DSPARK 单元格(INT4 与 MXFP4),因为它们没有对应的 NEXTN 单元格可复用,需要直接给出验证过的参数(如 --tp 2--mem-fraction-static 0.85)。
文件 模块 状态 重要度
docs/src/snippets/configs/inclusionAI/ling-3.0-flash.jsx 配置面板 modified 6.13
docs/src/snippets/configs/inclusionAI/ling-3.0-flash-benchmarks.jsx 基准数据 modified 5.63
docs/cookbook/autoregressive/InclusionAI/Ling-3.0-flash.mdx 文档 modified 2.14

关键源码片段

docs/src/snippets/configs/inclusionAI/ling-3.0-flash.jsx core-logic

重构 DSPARK 验证逻辑,引入验证集合,新增 INT4/MXFP4 单元格。

    // DSPARK 验证集合:hw|quant 对,已通过完整 GSM8K 评测
    const DSPARK_VERIFIED = new Set(["b200|bf16", "h200|bf16", "h200|fp8"]);    // 生成 DSPARK 孪生单元格:继承低延迟单元格,仅替换 NEXTN 标志
    const dsparkTwin = (cell, verified) => ({
      ...cell,
      verified,
      match: { ...cell.match, spec: "dspark" },
      flags: cell.flags.flatMap((f) =>
        f === "--speculative-algorithm NEXTN" ? DSPARK_FLAGS : [f]
      ),
    });    // 低延迟单元格与 DSPARK 孪生单元格组合
    const lowLatencyCells = [...];
    return [
      ...lowLatencyCells.flatMap((c) => [
        c,
        dsparkTwin(c, DSPARK_VERIFIED.has(`${c.match.hw}|${c.match.quant}`)),
      ]),
      // INT4/MXFP4 无 NEXTN 孪生来源,直接列出验证过的配置
      {
        match: { hw: "h200", quant: "int4", strategy: "low-latency", spec: "dspark" },
        verified: true,
        flags: ["--model-path {{MODEL_NAME}}", "--tp 2", ...DSPARK_FLAGS, "--mem-fraction-static 0.85"],
      },
      {
        match: { hw: "h200", quant: "mxfp4", strategy: "low-latency", spec: "dspark" },
        verified: true,
        flags: ["--model-path {{MODEL_NAME}}", "--tp 2", "--moe-runner-backend flashinfer_mxfp4", ...DSPARK_FLAGS, "--mem-fraction-static 0.85"],
      },
    ];
docs/src/snippets/configs/inclusionAI/ling-3.0-flash-benchmarks.jsx core-logic

新增四个 H200 DSPARK 单元格的基准数据。

    // H200 + BF16 DSPARK 基准
    {
      match: { hw: "h200", quant: "bf16", strategy: "low-latency", spec: "dspark" },
      sglang_version: "PR #33561 @ 76a3e673",
      accuracy: { gsm8k_pct: 96.36 },
      notes: "Full GSM8K stop rate 99.62%; accept length ~4.5-5.1.",
    },
    // ... 其余量化条目类似

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

主要风险在于 DSPARK 验证依赖 PR #33561 的特定 commit(76a3e6732b),若该 PR 后续有重大变更(如参数或默认行为改变),可能导致文档中标注的已验证配置失效。此外,MXFP4 单元格依赖 flashinfer_mxfp4 后端,如果环境不支持该后端,用户按照文档配置可能无法启动。

对用户而言,文档明确标注了 H200 上四种量化的 DSPARK 验证状态,提供了可靠的配置参考,降低试错成本。对系统而言,变更仅涉及文档与配置文件,不涉及运行时逻辑,影响范围为文档展示与部署面板,影响程度为低。对团队而言,明确了该功能的验证范围,便于后续维护与扩展。

依赖未合并的 PR #33561 MXFP4 后端依赖 flashinfer_mxfp4

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论