PaddleOCR-VL 文档修订:明确流水线定位并补充真实输出
执行摘要
本 PR 修订了 PaddleOCR-VL 的 cookbook 文档,澄清了 SGLang 在 PaddleOCR 文档解析流水线中的角色——它仅服务识别阶段,而非整个 pipeline。同时将示例输出从占位符替换为真实服务器输出,修正了不可用的示例图片 URL,并补充了表格识别输出为 OTSL 格式而非 HTML 的说明。纯文档变更,无代码或测试影响。
功能与动机
原 cookbook 将模型描述为“end-to-end page parsing ... and reading order”,这实际上混淆了 SGLang 与 PaddleOCR 流水线的职责。PR 作者指出,读者需要明确 SGLang 只提供识别能力,而布局检测、裁剪等由调用方完成,这解释了模型为何是 prompt-conditioned 而非指令跟随。同时,示例中的图片 URL 指向 example.com,无法运行,输出占位符也尚无内容。本次修订旨在提供准确、可运行的文档。
实现拆解
- 澄清模型定位:在
docs/cookbook/autoregressive/Baidu/PaddleOCR-VL.mdx 的介绍部分新增段落,明确 SGLang 服务的是 PaddleOCR 流水线中的识别阶段,而非流水线本身。
- 补充 OTSL 输出说明:在能力表格后新增说明,指出表格识别返回 OTSL 风格的 cell 标记,并附示例输出。
- 修正示例 URL:将 OCR 示例中的图片 URL 从
https://example.com/your_page.png 替换为 PaddleOCR 仓库中的真实图片地址。
- 填充示例输出:将两个“Pending update”占位符替换为真实的服务器输出。
见 key_files 中的标注片段,主要是在介绍部分增加了对模型定位的澄清说明。
评论区精华
仅有一条自动生成的 Mintlify 预览部署评论,无实质讨论。
风险与影响
纯文档变更,风险极低。唯一需要注意的是示例图片 URL 的长期有效性,若 PaddleOCR 仓库结构调整,示例可能失效。对用户而言,文档更清晰、示例可运行;对系统无影响。
关联脉络
本 PR 是 #35318 引入 PaddleOCR-VL cookbook 后的修订,体现了文档维护的迭代性。后续若有 PaddleOCR-VL 相关功能更新,建议同步检查此文档。
参与讨论