执行摘要
本 PR 为 Ascend NPU 添加了 Kimi-K2.5-w4a8 的最佳实践文档,包括配置表格、部署示例和格式修正。文档新增内容为主,无代码变更,但存在表格与命令参数不一致的潜在风险。
功能与动机
PR body 明确指出:'Add best practice for Kimi-K2.5-w4a8 on NPU platform.' 通过在官方文档中提供标准化的配置表格和可复用的部署命令,帮助用户在 Ascend NPU 上快速、正确地部署 Kimi-K2.5 模型。
实现拆解
- 新增配置章节:在
ascend_npu_best_practice.mdx 中插入 "Kimi Series Models" 小节,包含低延迟(Low Latency)和高吞吐(High Throughput)两张配置表格,并设置锚点链接指向详细示例文档。
- 修正占位符格式:在
ascend_npu_kimi_k2.5_examples.mdx 中,将路由器命令的 IP 占位符从 'your prefill ip1' 改为 <your_prefill_ip1>,提高规范性和可读性。
- 合并与 lint 修复:经过 5 次提交,包括合并 main 分支和修复 lint 问题。
以下为新增的 Kimi-K2.5 低延迟配置表格(JSX 语法):
{/* Kimi-K2.5 低延迟配置表 */}
<table style={{width: "100%"}}>
<thead>
<tr>
<th>Model</th>
<th>Hardware</th>
<th>Cards</th>
<th>Mode</th>
<th>Dataset</th>
<th>TPOT</th>
<th>Quant</th>
<th>Configuration</th>
</tr>
</thead>
<tbody>
<tr>
<td>Kimi-K2.5-w4a8</td>
<td>Atlas 800I A3</td>
<td>8</td>
<td>PD Mixed</td>
<td>3.5K+1.5K</td>
<td>20ms</td>
<td>W4A8 INT8</td>
<td><a href="#kimi-k25-w4a8-3_5k-1_5k-20ms-on-a3-8-cards-mixed-mode">Optimal Configuration</a></td>
</tr>
</tbody>
</table>
评论区精华
gemini-code-assist[bot] 在 review 中指出:文档表格和标题写 "8 cards",但示例命令中使用 --tp-size 16,存在矛盾;同时建议移除冗余的 transformers 安装命令。这些反馈未被采纳,PR 已由 sglang-npu-bot 审批合并。该不一致性需在后续 PR 中修正。
风险与影响
- 风险:表格中的 "8 cards" 与示例命令的
--tp-size 16 不一致,可能误导用户使用错误配置。建议读者以实际命令为准。
- 影响:为 NPU 用户提供 Kimi-K2.5 官方部署指南,降低配置门槛;无系统影响。
关联脉络
本 PR 与 #29492 同属 NPU 最佳实践文档更新系列,共同完善 Ascend NPU 上的模型部署指引。
参与讨论