Prhub

#32945 Qwen3.5 NVFP4 V2

原始 PR 作者 faradawn 合并时间 2026-08-08 06:26 文件变更 2 提交数 1 评论 2 代码增减 +4 / -4

执行摘要

Qwen3.5 文档 NVFP4 checkpoint 升级 V2

PR body 明确要求将 Qwen3.5 FP4 Blackwell checkpoint 从 nvidia/Qwen3.5-397B-A17B-NVFP4 更新为 nvidia/Qwen3.5-397B-A17B-NVFP4-V2,并以 SemiAnalysisAI/InferenceX 的 PR#2238 作为依据。仓库近期仍在修复 NVFP4 相关后端(如 PR#33543),说明该量化链路仍在持续演进,文档需要及时同步上游推荐的 checkpoint 版本,避免用户按旧文档拉取过时模型。

该 PR 改动极小,不值得精读代码,但建议文档维护者关注两点:一是全仓搜索确认没有遗漏旧 NVFP4 引用;二是考虑为 generateCommand 增加输出快照测试。同时可跟踪 SemiAnalysisAI/InferenceX 的 PR#2238,了解 V2 相对 V1 的变化原因,决定是否在文档中补充升级说明。

讨论亮点

该 PR 没有任何 review 评论线程,唯一交互是提交者在 issue 中请求审批:

提交者 faradawn:Hi @JustinTong0323 @zijiexia can you help comment/approve?

最终由维护者 ishandhanani 直接批准;gemini-code-assist[bot] 的评论仅说明其代码审查服务已停运,无技术含义。

实现拆解

  1. 部署命令生成器docs/src/snippets/autoregressive/qwen35-deployment.jsxgenerateCommand 函数负责生成 sglang serve 命令。本次将 modelName 在 FP4 分支下对 Blackwell 的路径改为 nvidia/Qwen3.5-397B-A17B-NVFP4-V2,并同步更新注释说明;AMD MI355X 的 MXFP4 分支保持不变。
  2. cookbook 指南docs/cookbook/autoregressive/Qwen/Qwen3.5.mdx 在模型对照表与 FP4 说明段落两处替换 NVFP4 的 Hugging Face 链接为 V2 版本,AMD MXFP4 链接不受影响。
  3. 配套改动:未新增测试、配置或部署相关改动;该变更通过文档站构建与 cookbook 渲染生效,属于纯展示层同步,风险面很小。
文件 模块 状态 重要度
docs/src/snippets/autoregressive/qwen35-deployment.jsx 文档站点 modified 4.1
docs/cookbook/autoregressive/Qwen/Qwen3.5.mdx 部署指南 modified 2.32

关键符号

generateCommand

关键源码片段

docs/src/snippets/autoregressive/qwen35-deployment.jsx core-logic

核心改动文件。文档站通过该 JSX 动态生成 Qwen3.5 的 `sglang serve` 部署命令,`modelName` 的选择直接决定用户拉取的模型路径;本次将 Blackwell NVFP4 分支指向 V2 checkpoint。

// generateCommand 是文档站生成 sglang serve 命令的核心函数。
// 这里聚焦展示 modelName 的 FP4 分支选择逻辑。
let modelName;
if (quantization === 'fp4') {
  // AMD MI355X 使用 MXFP4 checkpoint;Blackwell 使用 NVFP4-V2。
  // 本次更新将旧路径 `nvidia/Qwen3.5-397B-A17B-NVFP4` 改为 `...-NVFP4-V2`,
  // 对齐上游 InferenceX PR#2238 推荐的发布版本。
  modelName = hardware === 'mi355x'
    ? 'amd/Qwen3.5-397B-A17B-MXFP4'
    : 'nvidia/Qwen3.5-397B-A17B-NVFP4-V2';
} else {
  // 非 FP4 的 BF16 / FP8 继续按模型系列拼接 Hugging Face 模型名。
  const suffix = MODEL_SUFFIX[model];
  const quantSuffix = quantization === 'fp8' ? '-FP8' : '';
  modelName = `Qwen/Qwen3.5-${suffix}${quantSuffix}`;
}

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

  • 一致性风险:本次只覆盖 2 个文件,仓库其他文档或示例可能仍引用旧 NVFP4 名称,建议全仓搜索确认是否还有遗漏。
  • 外部依赖:新 checkpoint 来自 NVIDIA 的 Hugging Face 仓库,若上游调整名称或临时下架,按文档执行的用户会拉取失败。
  • 测试缺口generateCommand 没有对应的输出快照测试,未来模型名选择逻辑若被无意改动,文档站生成的部署命令可能偏离推荐配置而不易察觉。
  • 影响面:纯文档变更不触及 SGLang 运行时路径,技术风险很低。

对用户而言,文档站与 cookbook 中 Qwen3.5 FP4 Blackwell 的部署命令将指向 V2 checkpoint,按指南拉取的模型版本会随之变化;对系统运行时无任何影响;对团队而言主要是文档维护成本,需要留意其他位置是否仍引用旧名称。影响范围限定在文档/示例层面,程度低。

文档变更 无测试覆盖 外部模型引用

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论