扫描 PDF OCR 转 Markdown,只让真正需要的页面走视觉识别
扫描 PDF 本质上是一组页面图片,不是可搜索文字。更高效的流程是先检查文字层,只在需要时本地渲染页面并做 OCR,再把低置信度结果逐项对回原文。
直接答案:使用 OCR 前,先尝试划选并搜索页面上看得到的一句话。没有可用文字层时再渲染并识别;文字可正常划选时优先走文本转换。OCR 更慢、成本更高,也更容易引入字符错误。
怎样判断 PDF 是否需要 OCR
- 搜索页面上一个有辨识度的词。
- 拖选一句话,看选区是否跟着字符走。
- 放大观察:文字边缘模糊、压缩噪点一致,通常说明整页是图片。
- 不要只看第一页;附件、签字页和附录可能夹在普通数字 PDF 里。
PDF.js 提供页面渲染和文字内容 API,pdfmd 用这些浏览器端信号选择路径。这个判断很实用,但并非绝对:坏掉的字符映射可能让文字看似可选却无法使用,混合文档也仍需逐段检查。
OCR 能恢复什么,不能保证什么
| 页面信号 | 通常能恢复 | 常见失败 |
|---|---|---|
| 清晰印刷段落 | 文字与段落边界 | 断词或形近字 |
| 双栏扫描 | 大部分文字 | 阅读顺序交错 |
| 手写批注 | 清晰单词 | 人名、符号和短标记 |
| 密集表格或公式 | 部分标签与数值 | 单元格关系和记号 |
Tagged PDF 可以携带预期阅读顺序和语义结构,但扫描件通常没有可复用的 tag tree。OCR 只能从像素推断标题、分栏、列表和表格,所以这些结构在人工核验前都只是推测。
pdfmd 的扫描 PDF 路径
- 上传前先在浏览器检查文档是否存在可用文字层。
- 纯扫描 PDF 在浏览器渲染成逐页图像。
- 服务端验证登录和余额后,页面图像经 Cloudflare 发送到 Moondream 3.1 OCR。
- OCR 成功完成一页扣 4 点;失败扣 0 点。
- 结果不会自动保存,离开页面前要下载 Markdown。
官方资料与事实边界
以下链接支持规范与平台行为;pdfmd 的扣点和处理路径以本站价格页与隐私政策为准。
把复核清单保存下来
下载 Markdown 清单,下次转换时重复使用;格式变化会记录在公开 changelog。
常见问题
所有 PDF 都需要 OCR 吗?
不需要。可搜索文字 PDF 应先走文本转换;OCR 只用于纯图像页面或不可用的文字映射。
一份 PDF 能同时包含文字页和扫描页吗?
可以。合同和报告常夹着签字页或扫描附件,所以不能只看第一页。
为什么 OCR 会把双栏顺序弄乱?
扫描页只提供像素,没有明确阅读顺序;模型必须猜哪一栏先读。
扫描 PDF OCR 怎么扣点?
每个成功完成的 OCR 页面扣 4 个页面点数;转换失败扣 0 点。
拿真实扫描件验证分流
先用这套诊断判断是否值得做 OCR;确认价值之后,再用 Google 登录并通过页面点数处理扫描件。