研究论文
多栏排版、插图和引用。
查看原始来源 · arXiv也可以直接选择文件。数字 PDF 在本机解析,不会上传。
载入 PDF 后,Markdown 会显示在这里。
这款免费在线 PDF 转 Markdown 转换器通过 PDF.js 在本机解析文本层,生成可复制、可下载的干净 Markdown,也能直接用于 Obsidian、MkDocs、GitHub 与 RAG 流程。
普通 PDF 转 Markdown 转换器往往只给出看似正确的文本;这里的每个输出区块都会保留页码、坐标、阅读顺序、提取方式和置信度,让漏掉的脚注或错乱的双栏顺序可以回到原文核验。
普通数字 PDF——论文、手册、合同、Word 或 LaTeX 导出的文件——在本地免费转换,不上传、不注册。扫描件、密集表格和公式才是本地提取搞不定的情况,这类页面会被单独标出,你可以逐页确认是否升级 OCR,而不必为整份文档重新付费。
每张卡片都会通过与用户文件完全相同的本地转换流程加载真实 PDF。
多栏排版、插图和引用。
查看原始来源 · arXiv审计报表、密集表格和脚注。
查看原始来源 · SEC EDGAR中文标题、编号章节和混合标点。
查看原始来源 · MOST China可靠的 PDF 转 Markdown 转换器应先检查每一页。文本页在本地处理,只有扫描、表格或公式页面才建议升级到 Advanced OCR。
在浏览器检测文本层、阅读顺序和困难页面。
上传前看清需要 OCR 的页面与准确费用。
点击任意 Markdown 区块,返回原 PDF 的对应位置。
PDF 转 Markdown 转换完成后,可导出干净 Markdown,或选择保留工作流元数据的输出配置。
每份测试文档都公开输入、输出、解析器版本和已知问题。
| 文档类型 | 文本 | 阅读顺序 | 表格 | 来源链接 |
|---|---|---|---|---|
| 数字研究论文 | 99.1% | 98.6% | 94.2% | 100% |
| 双语扫描报告 | 96.8% | 95.4% | 91.7% | 100% |
| 财务报表 | 98.4% | 97.1% | 93.8% | 100% |
原型数据用于展示报告结构;生产数据将来自公开测试集。
只有页面需要更强 OCR、自动化或团队协作时才付费。
创建任务、选择输出配置,并接收 Markdown 与逐页来源信息。
curl https://api.pdfmd.org/v1/jobs \
-H "Authorization: Bearer $PDFMD_KEY" \
-F "file=@paper.pdf" \
-F "profile=source-linked"
→ { "status": "processing", "local_pages": 12,
"advanced_pages": [8, 9] }每篇 PDF 转 Markdown 转换器教程都包含可下载样例、预期输出、失败模式和修复方式,不生产泛泛的关键词文章。
关于转换流程、隐私、质量与限制的常见疑问。
在页面顶部选择 PDF,或直接打开内置示例。文档会在浏览器中解析,Markdown 与原始页面并排显示。用「复制」把内容放进其它编辑器,或用「下载」保存干净 Markdown,以及带 frontmatter 和页码锚点的 Obsidian 版本。
免费。数字 PDF 的本地转换不需要注册,单个文件也没有页数限制。只有需要 Advanced OCR 的页面才消耗点数,而且上传前会先让你逐页确认。
本地模式不会。文本提取在浏览器内完成,文档内容不发起网络请求。页面上的计数器会显示有多少页离开了设备——在你明确同意 OCR 升级之前,它始终是 0。
扫描件没有文本层,本地提取读不出内容。pdfmd 会识别出这类页面并标记为需要 OCR,而不是悄悄返回一份空的 Markdown。
简单表格会转成 GFM 表格。跨页表格和合并单元格会在「来源」面板中标注出来供你核对;复杂版面也可以导出成来源映射 JSON,而不是被压平成纯文本。
粘贴进 Obsidian、Notion 或任意 Markdown 编辑器,提交到 MkDocs、Docusaurus 之类的文档站,或者分块用于检索增强生成。Obsidian 导出还会附带 frontmatter、目录和回到原页的锚点。