PDF 转换器Word 转换当前没有打开的文档
把 Word 文档拖到这里
只支持 .docx,最大 25 MB。老的 .doc 需要先另存为 .docx。转换完成后,Markdown 会按区块出现在这里。点任意一块,就能看到它在原文的位置。
- 已保留在 Markdown 里有直接对应的写法。
- 已降级转过来了,但结构比原文少。
- 已丢弃Markdown 里没有对应写法,需要手工补。
这份审计会数的结构
- 合并单元格
- 公式
- 修订
- 批注
- 文本框
- 页眉页脚
- 以引用方式保留的图片
转换一份 .docx 之后,word转markdown 的审计会出现在这里,逐条列出保留、降级和丢弃的结构。
想验证?断网之后再转一次,一样能用——因为根本没有需要发出去的数据。
为什么这次转换一定有损word转markdown 在线转换器
在浏览器里把 .docx 转成 Markdown,并给出一份转换审计:哪些结构保留了、哪些被降级、哪些直接丢了。文件不上传,不用注册。
为什么 word转markdown 一定会丢东西
.docx 本质是一个 zip 包,里面的 XML 描述的是「一页纸」:样式、修订记录、浮动文本框、页眉页脚、自动编号规则。Markdown 描述的是「一篇文档」:标题、段落、列表、表格、链接、代码。两者中间重叠,边缘各走各的,而边缘上的东西总得有个去处。
多数工具的做法是先把 .docx 压成 HTML,再转成 Markdown。这条路本身没问题,但证据在 HTML 那一步就没了:合并单元格变成三个普通单元格,修订删除变成正文,公式干脆消失。后面的环节无从提醒你,于是输出看起来是完整的。
这个页面直接读 OOXML,一边转一边把这些结构数出来,所以审计能把它们一条条点名。有损躲不掉,能做到的是把损失列清楚,而不是让它无声无息。
| Word 里的东西 | Markdown 的对应写法 | 实际结果 |
|---|---|---|
| 标题 1–6 样式 | # 到 ###### | 直接转换,中文「标题 1」样式同样能识别 |
| 项目符号与自动编号 | - 与 1. | 层级保留;字母、罗马数字编号会变成普通数字 |
| 表格 | GFM 竖线表格 | 只要没有合并单元格和嵌套表就可靠 |
| 合并单元格 | 没有对应写法 | 内容留在第一格,其余补空 |
| 公式(OMML) | 没有对应写法 | 如实报数量,需要你改写成 LaTeX |
| 批注与修订 | 没有对应写法 | 插入被接受,删除与批注被移除 |
| 页眉页脚、文本框 | 没有对应写法 | 属于版面,不属于正文流 |
转完先查这五件事
两分钟的核对,能拦下绝大多数 word转markdown 之后「一周才发现」的问题——那时候内容通常已经进了语雀或者 Wiki。
先翻表格
合并单元格是最常见的翻车点。对着原文核一下行数和表头。中文文档里的三线表、跨行表头、带小计行的报表最容易错位,审计报了合并单元格就必须手工过一遍。
搜三个数字
从文档中段挑三个数字,去输出里搜一下。搜不到通常不是转丢了,而是这个数原本就在文本框或页眉里,不在正文。
找公式
审计报了公式数量,就说明它们没有进 Markdown。中文期刊论文、教材、技术方案里这一项最要命,趁记得位置赶紧改写成 LaTeX。
确认这是终稿
转换时修订会被静默接受。需求说明书、投标文件、制度文件常常带着一堆没处理的修订,先在 Word 里接受或拒绝,Markdown 才是你想发布的那一版。
想清楚图片怎么放
默认图片单独存成 media/ 里的文件、正文用相对路径引用,下载时选「.md + 图片」一起带走;要提交到 Git 仓库或贴进语雀、飞书,这也是最省事的形态。只有需要单文件时才切到 base64 内联。
转出来之后放哪里
转换只是一半,导出格式才决定这份 Markdown 到了目的地能不能直接用。
- 干净 Markdown
- 只有正文,没有多余标记。贴进语雀、飞书文档、Issue 或 PR 最合适。
- Obsidian 笔记
- 带 frontmatter、目录和块 ID,一份需求文档转完就是一条能被引用的笔记。
- GitHub / MkDocs
- 带 frontmatter、稳定的标题锚点和来源注释,适合多人协作的文档站。
- RAG 分块
- JSONL 分块并保留标题上下文,把 Word 文档喂给检索管线时不丢结构。
四种都跑在同一次本地转换上。带坐标的来源映射仍然只属于 PDF——.docx 里根本没有页面坐标可以映射。 查看全部输出格式
Word 和 PDF,该转哪个
两个都有就转 .docx。word转markdown 是从真实结构出发的:Word 文件里还保存着标题样式、编号、单元格、脚注关系。同一份文件导出的 PDF 只剩下坐标上的字形,所有结构都得靠位置和字号反推回来。
例外是这份文档只有 PDF,或者版面本身就是内容:扫描件、双栏论文、跨页的财报表格。那种情况请走 PDF 这条线。
word转markdown 常见问题
我的 Word 文档会被上传吗?
不会。word转markdown 全程在你的浏览器里完成:.docx 在本地解压、解析、转成 Markdown。断网也能用。没有账号、没有排队、服务器上也没有副本。
和用 pandoc 转有什么区别?
pandoc 很好,输出质量相当,但它是命令行工具,而且不会告诉你丢了什么。这个页面补的是它前面那一步:转完先看审计,知道哪几处需要手工补。
支持 .doc 吗?
不支持。老的二进制 .doc 不是 zip + XML,读不了。请先用 Word、WPS 或 LibreOffice 另存为 .docx。
Word 里的图片怎么处理?
word转markdown 默认把每张图片导出成 media/ 里的文件,正文只留一行 ``,因为一张照片转成 base64 就是几万个字符,正文会被淹掉、diff 也没法看。下载时选「.md + 图片」,两者一起打包成 zip;需要单文件再切到 base64 内联,不要图片就选「不要图片」。
表格能保留吗?
能,转成 GFM 表格。但 Markdown 表格没有合并单元格,遇到合并会补空并在审计里标成「已降级」,而不是悄悄把你的数据重排。
为什么审计说公式「丢弃」了?
Word 用 OMML 这种微软自家的 XML 存公式,Markdown 没有对应写法。与其塞一个看起来像内容的占位符,不如如实报出数量,让你自己改成 LaTeX。
现在转一份 Word 文档
免费、本地、不用注册。这个 word转markdown 工具把审计算作免费转换的一部分,不是增值项。