PDF 来源映射 JSON:把 Markdown 区块追溯到现有证据
来源映射只有在明确区分“已观察证据”和“缺失数据”时才有价值。pdfmd 导出页码归属、Markdown 偏移、提供方方法,以及真实返回的坐标或置信度,不会为填满字段而编造值。
直接答案:把来源映射 JSON 当作复核索引,不要当作正确性证明。先验证 schema_version,再用偏移定位 Markdown,打开对应原页;坐标或置信度为 null 时,就按“证据不可用”处理。
pdfmd.source-map.v1 记录哪些内容
| 层级 | 字段 | 含义 |
|---|---|---|
| document | 文件名、页数、Markdown、导出时间 | 转换后的整体产物 |
| page | 尺寸、方法、偏移、block ID | 可获得的页面级归属 |
| block | 类型、页码、Markdown、方法、偏移 | 一个提取单元 |
| 可选证据 | bbox、confidence、provider source | 提供方不同,因此允许 null |
顶层 schema_version 是兼容性契约。消费程序遇到陌生版本时应拒绝或迁移,而不是假定未来字段永远不变。RFC 8259 把 JSON object 定义为无序 name/value 集合,因此下游必须按字段名读取,不能依赖展示顺序。
怎样核验一条提取结论
- 在 document.markdown 找到结论,确认 block 的 markdown_start 与 markdown_end 选中同一段文字。
- 打开所报原始页,对照完整句子、标题、表格行或脚注。
- 解释 confidence 前先看 method;不同提供方会返回不同证据。
- bbox 或 confidence 为 null 时记录为不可用,不要把 null 换成 0。
- 把原始 PDF 与 source map 放在同一个数据集或文档版本下。
"id": "p4b7",
"page": 4,
"method": "cloudflare",
"markdown_start": 1288,
"markdown_end": 1412,
"bbox": null,
"confidence": null来源映射不能证明什么
Provenance 有助于判断可靠性,但不等于正确性。W3C PROV 把 provenance 描述为生产一份数据时涉及的实体、活动和人员信息。页码与方法能解释输出从哪里来,却不能证明表头、公式、阅读顺序或 OCR 字符一定解释正确。
- 不要只凭 confidence 计算准确率百分比。
- 不能因为 schema 有 bbox 字段就假设所有区块都有坐标。
- 修改 Markdown 后不能继续使用旧偏移,除非重新生成 map。
- 提取内容要支撑重要结论时,不要丢掉原始 PDF。
官方资料与事实边界
以下链接支持规范与平台行为;pdfmd 的扣点和处理路径以本站价格页与隐私政策为准。
把复核清单保存下来
下载 Markdown 清单,下次转换时重复使用;格式变化会记录在公开 changelog。
常见问题
来源映射 JSON 和 JavaScript source map 是一回事吗?
不是。这是 pdfmd 的文档 provenance 格式,用来连接 Markdown、页码、区块、方法和现有证据。
为什么 bbox 和 confidence 有时是 null?
并非所有转换提供方都会返回坐标或数值置信度。null 表示证据不可用,不是 0。
编辑 Markdown 后还能沿用旧偏移吗?
不能。文字改动会移动字符位置;修改后需要重新生成,或明确给 map 做版本管理。
来源映射能证明转换准确吗?
不能。它让复核可追溯;表格、公式、分栏和 OCR 仍要回到 PDF 对照。
只导出真实存在的证据
转换真实 PDF 后选择来源映射 JSON。Google 登录和页面点数用于云端转换;导出的 map 只下载到本地,不会自动进入账号资料库。