Prhub

#35836 [NPU] [DOC] Refresh supported features and models on Ascend NPU

原始 PR 作者 amote-i 合并时间 2026-08-23 13:05 文件变更 2 提交数 7 评论 1 代码增减 +159 / -33

执行摘要

刷新 Ascend NPU 支持模型与参数功能矩阵

PR body 仅一句话:Refresh supported features and models on Ascend NPU。结合提交内容和 NPU 后端持续演进(新增调度、MoE 并行、SWA、流水线并行等参数支持),原文档停留在此前的能力边界,需要将已适配的模型和参数状态同步刷新,避免用户误判 NPU 平台不支持这些能力。

值得快速浏览:可借此了解 Ascend NPU 当前真实的能力边界(调度、MoE 并行、SWA、LoRA、多模态模型等)。不建议精读代码,因为没有代码变更。关注点放在 --retraction-policy--enable-session-radix-cache--default-chat-template-kwargs 等新声明参数的语义,以及 grok-2 移除是否影响现有部署。对维护者的建议:后续类似状态升级应附上对应适配 PR 链接或验证命令,增强文档可信度。

讨论亮点

该 PR 没有实质性的开发者 review 讨论。唯一评论是 sglang-npu-bot 触发的 /tag-and-rerun-ci 流程指令,最终由 sglang-npu-bot 直接 APPROVED 并合并。commit 历史中的 "fix docs review" 表明存在一次线下 review 意见修正,但讨论内容未留存在 PR 评论区。整体属于 NPU 专项 bot 自动化维护流程的典型文档提交。

实现拆解

  1. 刷新支持功能表(docs/docs/hardware-platforms/ascend-npus/reference/support_features.mdx):将 --swa-full-tokens-ratio--disable-hybrid-swa-memory--enable-dynamic-chunking--moe-data-parallel-size--pp-max-micro-batch-size--pp-async-batch-depth--model-checksum--lora-strict-loading 等参数从 Planned/Experimental/Special for GPU 状态升级为 A2/A3 可用;新增 --retraction-policy--enable-session-radix-cache--default-chat-template-kwargs 三个参数行;同时修正 --pp-async-batch-depth 的默认值从 None 更正为 0,消除文档与实现的不一致。
  2. 刷新支持模型表(docs/docs/hardware-platforms/ascend-npus/reference/support_models.mdx):新增 Qwen/Qwen3.8-2.4T-A95B、sgl-npu/Kimi-K3-W4A8、iridiumine/MiMo-V2-Flash-W8A8、LiquidAI/LFM2 系列(1.2B 与 8B-A1B MoE)、tiiuae/Falcon-H1-34B-Instruct、ibm-granite/granite-4.0 两个变体、poolside/Laguna-XS.2、Tencent-Hunyuan/Hy3、deepseek-ai/DeepSeek-OCR-2、LLaVA 视频变体等十余个模型行;移除 huihui-ai/grok-2 行。模型行结构为 模型 ID / 系列名 / 两个支持状态勾选列。
  3. 提交演进与收尾:7 个 commit 按模块拆分提交,先是功能表状态升级(11ac085、0ca69fe、dc02401),再是模型表新增(2890ed7、1a8708f),中间穿插 "update feature requirements and models" 和 "fix docs review" 两次整合修正,说明开发过程中经过一次线下 review 反馈后的调整。
文件 模块 状态 重要度
docs/docs/hardware-platforms/ascend-npus/reference/support_models.mdx NPU 文档 modified 4.78
docs/docs/hardware-platforms/ascend-npus/reference/support_features.mdx NPU 文档 modified 4.53

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

该 PR 无实质人工 review 讨论 other

PR 仅有一条 sglang-npu-bot 的 `/tag-and-rerun-ci` 流程评论,随后 bot 直接 APPROVED 并合并,未发现开发者之间的技术讨论。commit 历史中的 "fix docs review" 提示存在一次线下 review 修正。

结论:由 NPU 专项 bot 自动批准合并,文档准确性依赖作者自查与线下 review 修正。 · 已解决

风险与影响

  1. 文档与实现一致性风险:support_features.mdx 中多个参数(如 --moe-data-parallel-size--pp-async-batch-depth--lora-strict-loading)从 Planned/Experimental/Special for GPU 直接升级为 A2/A3 支持,PR 未提供对应的验证记录、测试或到适配代码的引用;若实际 NPU 后端覆盖不完整,会误导用户上线后才发现能力缺失。
  2. 移除 grok-2 未说明原因:support_models.mdx 删除了 huihui-ai/grok-2 行,PR body 无任何解释,既有用户可能困惑该模型是停止支持还是表格整理。
  3. 新增模型声明缺乏验证证据:新增的 DeepSeek-OCR-2、Hunyuan Hy3、Granite 4.0 等多模态/大规模模型没有关联 cookbook、精度或性能数据(PR body 的 Accuracy/Speed Tests 均为 N/A)。
  4. CI 状态:PR Test 通过但 Extra 运行失败(Run #32469616390),失败原因未在 PR 内说明,且不影响 bot 合并。

对用户:这两张表格是 Ascend NPU 使用者判断参数可用性和模型选型的一手依据,本 PR 扩大了可用范围(新增模型与提升参数状态),若文档与实际实现有偏差会增加排障成本。对系统:纯文档变更,无运行时影响。对团队:文档由 amote-i 维护、sglang-npu-bot 自动批准合并,流程高效但缺少人工二次审阅;文档状态变更(Planned→Supported)缺少与适配代码或验证数据的绑定,长期看可能积累文档漂移。

文档与实现一致性风险 移除模型未说明原因 自动合并缺人工审阅 状态升级缺验证证据

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论