Prhub

#35458 [Docs] PaddleOCR-VL: say which stage of the pipeline this serves, show real output

原始 PR 作者 mickqian 合并时间 2026-08-19 21:27 文件变更 1 提交数 1 评论 1 代码增减 +47 / -4

执行摘要

明确 PaddleOCR-VL 文档的流水线定位并补真实输出

PR body 指出原 cookbook 将模型描述为“end-to-end page parsing ... and reading order”,但这实际上是 PaddleOCR 流水线的职责,而非 SGLang 所服务的识别模型。这种模糊描述可能误导读者对 SGLang 功能边界的理解。此外,示例中的图片 URL 指向 example.com,无法运行;输出占位符“Pending update”也尚未填充。作者希望明确边界、提供可运行示例并展示真实输出,帮助读者正确使用模型。

值得快速浏览,以确认文档修订的准确性,特别是 OTSL 格式说明和示例图片 URL 的稳定性。对于使用 PaddleOCR-VL 的用户,此 PR 澄清了关键的使用边界,建议阅读。该 PR 本身技术深度有限,但文档维护的严谨性(使用真实输出)值得肯定。

讨论亮点

仅有一条来自 mintlify[bot] 的自动评论,提供文档预览部署链接,无实质讨论。无人工 review 评论或线程。

实现拆解

本 PR 仅修改一个文档文件 docs/cookbook/autoregressive/Baidu/PaddleOCR-VL.mdx,具体改动如下:

  1. 修订介绍部分:将原文中关于模型功能的描述“recognizes text, tables, formulas, charts and seals”保留,并新增一段说明,明确指出 SGLang 服务的是 PaddleOCR 流水线中的识别阶段,而非流水线本身;布局检测、裁剪、阅读顺序和 markdown/JSON 组装均由 PaddleOCR 完成。此澄清解释了模型为何是 prompt-conditioned(由调用方决定裁剪区域类型)。
  2. 补充表格识别输出说明:在能力表格后新增一段说明,指出结构化任务返回 OTSL 风格的 cell 标记(<fcel><nl>),而非 HTML,并添加了对应的示例输出折叠块。
  3. 修正 OCR 示例图片 URL:将硬编码的 https://example.com/your_page.png 替换为 PaddleOCR 仓库中的真实图片 URL,使示例可直接运行。
  4. 填充示例输出:将两个“Pending update”占位符替换为真实的服务器输出(如 ACKNOWLEDGEMENTS 文本),并注明多页块的内容已按标记压缩。
    这些改动不涉及任何代码、测试或配置变更,仅影响文档的可读性和准确性。
文件 模块 状态 重要度
docs/cookbook/autoregressive/Baidu/PaddleOCR-VL.mdx 文档 modified 4.1

分析完成后,这里会展示 LLM 生成的相对完整源码片段和详细注释。

评论区精华

没有提炼出高价值讨论线程

当前评论区没有形成足够清晰的争议点或结论,后续有更多讨论时会体现在这里。

风险与影响

本 PR 仅修改文档文件,不涉及任何代码逻辑或配置,因此技术风险极低。主要风险在于文档中新增的真实输出内容是否与模型实际行为完全一致(例如 OTSL 格式描述),以及示例图片 URL 的长期有效性。若 PaddleOCR 仓库中的图片路径变更,示例可能失效。但这些风险不影响系统运行,仅影响文档可用性。

影响范围限于 PaddleOCR-VL 的文档 cookbook。对用户而言,文档更清晰、示例可运行、输出可信。对系统无任何影响。对团队而言,这是一个纯文档 PR,减少了后续关于 SGLang 与 PaddleOCR 边界问题的潜在误解。影响程度较低。

文档准确性依赖外部 URL 稳定性

关联 Issue

未识别关联 Issue

当前没有检测到明确关联的 Issue 链接,后续同步到相关引用后会出现在这里。

完整报告

参与讨论