Prhub

#34250 Update dspark draft path in Inkling small cookbook

原始 PR 作者 ispobock 合并时间 2026-08-10 17:12 文件变更 2 提交数 1 评论 1 代码增减 +5 / -5

执行摘要

Inkling-Small cookbook 的 DSPARK draft 路径更新为正式版

PR body 为贡献模板、未填写实质内容,关联 Issue 为空。从分支名 use-released-dspark-draft 和变更内容可判断动机:DSpark 的独立 draft checkpoint 已从 Preview 状态转正发布,而 cookbook 仍引用 RadixArk/Inkling-Small-DSpark-Preview,继续使用旧路径会导致按文档部署的用户拉取到过时权重,因此统一替换为正式仓库名 RadixArk/Inkling-Small-DSpark

不值得精读。若读者准备在 Inkling-Small 上部署 DSPARK 投机解码,可顺带查看该 jsx 配置块中的完整 flag 集合(如 --mamba-radix-cache-strategy extra_buffer--mem-fraction-static 0.68--speculative-draft-model-quantization unquant),理解独立 draft 权重不占 FP4 目标配额的显存设计;除此之外无技术含量。

讨论亮点

本 PR 无任何 review 评论或技术讨论,唯一评论来自 mintlify[bot] 的文档预览部署通知:“Preview deployment for your docs... | lmsysorg | 🟢 Ready | View Preview”。该评论仅确认文档站点渲染可用,未涉及代码或配置争议。

实现拆解

  1. 更新启动参数片段 docs/src/snippets/configs/thinkingmachines/inkling-small.jsx:在 b200b300gb300h200 四个 strategy: "dspark" 配置块中,将 --speculative-draft-model-path 的值从 RadixArk/Inkling-Small-DSpark-Preview 改为 RadixArk/Inkling-Small-DSpark;同一配置中的 --speculative-algorithm DSPARK--speculative-draft-model-quantization unquant 等参数保持不变,draft 权重仍以非量化方式加载。
  2. 同步手册正文 docs/cookbook/autoregressive/ThinkingMachines/Inkling-Small.mdx 的 §3.7:将描述 DSpark 的段落中的 checkpoint 名称同步为正式名称,保持“独立 draft checkpoint、与 NVFP4 主模型并置服务”的整体表述不变。
  3. 配套与验证:无测试和部署配置改动;mintlify bot 已生成文档 Preview 部署且状态为 Ready,渲染通过。CI 的 Latest PR Test (Extra) 显示为失败(x),但 PR 由作者直接合并,失败任务与本文档变更无直接证据关联。
文件 模块 状态 重要度
docs/src/snippets/configs/thinkingmachines/inkling-small.jsx 文档片段 modified 4.3
docs/cookbook/autoregressive/ThinkingMachines/Inkling-Small.mdx 部署手册 modified 2.14

关键源码片段

docs/src/snippets/configs/thinkingmachines/inkling-small.jsx configuration

本次变更主体:b200/b300/gb300/h200 四个 DSPARK 部署配置块中的 `--speculative-draft-model-path` 从 `-Preview` 统一改为正式路径 `RadixArk/Inkling-Small-DSpark`,是用户复制的核心启动参数来源。

// docs/src/snippets/configs/thinkingmachines/inkling-small.jsx 中
// B200 NVFP4 + DSPARK 单机配置块;b300/gb300/h200 的块仅 tp 与
// mem-fraction 数值不同,draft 路径改动完全一致。
// DSpark 使用独立 draft checkpoint 做投机解码,该 checkpoint 不做 NVFP4
// 量化,因此其权重不占用 FP4 目标配额,`mem-fraction-static` 可放宽到 0.68。
{
  match: { hw: "b200", variant: "default", quant: "nvfp4", strategy: "dspark", nodes: "single" },
  verified: true,
  env: [
    // 启用统一 Radix Cache,配合下方 mamba-radix-cache-strategy 的 extra_buffer 策略
    "SGLANG_ENABLE_UNIFIED_RADIX_TREE=1",
  ],
  flags: [
    "--trust-remote-code",
    "--model-path {{MODEL_NAME}}",
    "--tp 8",
    "--quantization modelopt_fp4", // 主模型走 NVIDIA ModelOpt FP4 量化
    "--attention-backend fa4",
    "--page-size 128",
    "--fp4-gemm-backend flashinfer_trtllm",
    "--moe-runner-backend flashinfer_trtllm_routed",
    "--enable-torch-symm-mem",
    "--mamba-radix-cache-strategy extra_buffer",
    "--mem-fraction-static 0.68", // draft 权重在显存配额之外,静态占比可略高
    "--swa-full-tokens-ratio 0.1",
    "--mamba-full-memory-ratio 0.1",
    "--enable-multimodal",
    "--max-running-requests 68",
    "--reasoning-parser inkling",
    "--tool-call-parser inkling",
    "--skip-server-warmup",
    "--speculative-algorithm DSPARK",
    // 本次变更:由 Preview 版本切换为正式发布的 draft checkpoint
    "--speculative-draft-model-path RadixArk/Inkling-Small-DSpark",
    "--speculative-draft-model-quantization unquant",
    "--chunked-prefill-size 8192",
    "--cuda-graph-max-bs-prefill 8192",
    "--disable-flashinfer-autotune",
    "--host {{HOST_IP}}",
    "--port {{PORT}}",
  ],
}

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

整体风险极低,但有两个可留意点:

  1. 新路径 RadixArk/Inkling-Small-DSpark 依赖 Hugging Face 上存在对应模型仓库,若该仓库被下架或改名,按 cookbook 部署的用户会拉取失败;配置块中 verified: true 仅明确标注 B200 端到端验证过,b300/gb300/h200 配置的验证情况未单独说明。
  2. 已按旧路径 -Preview 部署的用户在升级文档后可能产生路径不一致的困惑,但这属于文档演进而非回归。此外 CI Extra 任务失败原因未知,建议后续观察是否与文档站点构建相关。

影响范围限于文档与示例配置的用户侧:按 cookbook 部署 DSPARK 策略的用户将默认拉取正式版 draft checkpoint;对 SGLang 运行时、内核或调度逻辑零影响。团队侧维护成本极低,仅需保证后续 draft 模型路径变更时同步更新该文档片段。

依赖外部模型仓库路径 纯文档变更

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论