返回 PDF 转 Markdown 总指南
实战指南 · 扫描 PDF

扫描 PDF OCR 转 Markdown,只让真正需要的页面走视觉识别

扫描 PDF 本质上是一组页面图片,不是可搜索文字。更高效的流程是先检查文字层,只在需要时本地渲染页面并做 OCR,再把低置信度结果逐项对回原文。

直接答案:使用 OCR 前,先尝试划选并搜索页面上看得到的一句话。没有可用文字层时再渲染并识别;文字可正常划选时优先走文本转换。OCR 更慢、成本更高,也更容易引入字符错误。

怎样判断 PDF 是否需要 OCR

  • 搜索页面上一个有辨识度的词。
  • 拖选一句话,看选区是否跟着字符走。
  • 放大观察:文字边缘模糊、压缩噪点一致,通常说明整页是图片。
  • 不要只看第一页;附件、签字页和附录可能夹在普通数字 PDF 里。

PDF.js 提供页面渲染和文字内容 API,pdfmd 用这些浏览器端信号选择路径。这个判断很实用,但并非绝对:坏掉的字符映射可能让文字看似可选却无法使用,混合文档也仍需逐段检查。

OCR 能恢复什么,不能保证什么

页面信号通常能恢复常见失败
清晰印刷段落文字与段落边界断词或形近字
双栏扫描大部分文字阅读顺序交错
手写批注清晰单词人名、符号和短标记
密集表格或公式部分标签与数值单元格关系和记号

Tagged PDF 可以携带预期阅读顺序和语义结构,但扫描件通常没有可复用的 tag tree。OCR 只能从像素推断标题、分栏、列表和表格,所以这些结构在人工核验前都只是推测。

pdfmd 的扫描 PDF 路径

  • 上传前先在浏览器检查文档是否存在可用文字层。
  • 纯扫描 PDF 在浏览器渲染成逐页图像。
  • 服务端验证登录和余额后,页面图像经 Cloudflare 发送到 Moondream 3.1 OCR。
  • OCR 成功完成一页扣 4 点;失败扣 0 点。
  • 结果不会自动保存,离开页面前要下载 Markdown。

官方资料与事实边界

以下链接支持规范与平台行为;pdfmd 的扣点和处理路径以本站价格页与隐私政策为准。

把复核清单保存下来

下载 Markdown 清单,下次转换时重复使用;格式变化会记录在公开 changelog。

下载清单查看 changelog

常见问题

所有 PDF 都需要 OCR 吗?

不需要。可搜索文字 PDF 应先走文本转换;OCR 只用于纯图像页面或不可用的文字映射。

一份 PDF 能同时包含文字页和扫描页吗?

可以。合同和报告常夹着签字页或扫描附件,所以不能只看第一页。

为什么 OCR 会把双栏顺序弄乱?

扫描页只提供像素,没有明确阅读顺序;模型必须猜哪一栏先读。

扫描 PDF OCR 怎么扣点?

每个成功完成的 OCR 页面扣 4 个页面点数;转换失败扣 0 点。

拿真实扫描件验证分流

先用这套诊断判断是否值得做 OCR;确认价值之后,再用 Google 登录并通过页面点数处理扫描件。

打开 PDF 转换器