PDF 转换器Word 转换当前没有打开的文档

本地转换 — 文件不离开你的电脑
原始 Word 文档按 .docx 正文顺序还原,不是逐页版式还原

把 Word 文档拖到这里

只支持 .docx,最大 25 MB。老的 .doc 需要先另存为 .docx。
Markdown 输出

转换完成后,Markdown 会按区块出现在这里。点任意一块,就能看到它在原文的位置。

  • 已保留在 Markdown 里有直接对应的写法。
  • 已降级转过来了,但结构比原文少。
  • 已丢弃Markdown 里没有对应写法,需要手工补。

这份审计会数的结构

  • 合并单元格
  • 公式
  • 修订
  • 批注
  • 文本框
  • 页眉页脚
  • 以引用方式保留的图片

转换一份 .docx 之后,word转markdown 的审计会出现在这里,逐条列出保留、降级和丢弃的结构。

当前没有打开的文档

想验证?断网之后再转一次,一样能用——因为根本没有需要发出去的数据。

为什么这次转换一定有损

word转markdown 在线转换器

在浏览器里把 .docx 转成 Markdown,并给出一份转换审计:哪些结构保留了、哪些被降级、哪些直接丢了。文件不上传,不用注册。

为什么 word转markdown 一定会丢东西

.docx 本质是一个 zip 包,里面的 XML 描述的是「一页纸」:样式、修订记录、浮动文本框、页眉页脚、自动编号规则。Markdown 描述的是「一篇文档」:标题、段落、列表、表格、链接、代码。两者中间重叠,边缘各走各的,而边缘上的东西总得有个去处。

多数工具的做法是先把 .docx 压成 HTML,再转成 Markdown。这条路本身没问题,但证据在 HTML 那一步就没了:合并单元格变成三个普通单元格,修订删除变成正文,公式干脆消失。后面的环节无从提醒你,于是输出看起来是完整的。

这个页面直接读 OOXML,一边转一边把这些结构数出来,所以审计能把它们一条条点名。有损躲不掉,能做到的是把损失列清楚,而不是让它无声无息。

Word 里的东西Markdown 的对应写法实际结果
标题 1–6 样式# 到 ######直接转换,中文「标题 1」样式同样能识别
项目符号与自动编号- 与 1.层级保留;字母、罗马数字编号会变成普通数字
表格GFM 竖线表格只要没有合并单元格和嵌套表就可靠
合并单元格没有对应写法内容留在第一格,其余补空
公式(OMML)没有对应写法如实报数量,需要你改写成 LaTeX
批注与修订没有对应写法插入被接受,删除与批注被移除
页眉页脚、文本框没有对应写法属于版面,不属于正文流

转完先查这五件事

两分钟的核对,能拦下绝大多数 word转markdown 之后「一周才发现」的问题——那时候内容通常已经进了语雀或者 Wiki。

  1. 先翻表格

    合并单元格是最常见的翻车点。对着原文核一下行数和表头。中文文档里的三线表、跨行表头、带小计行的报表最容易错位,审计报了合并单元格就必须手工过一遍。

  2. 搜三个数字

    从文档中段挑三个数字,去输出里搜一下。搜不到通常不是转丢了,而是这个数原本就在文本框或页眉里,不在正文。

  3. 找公式

    审计报了公式数量,就说明它们没有进 Markdown。中文期刊论文、教材、技术方案里这一项最要命,趁记得位置赶紧改写成 LaTeX。

  4. 确认这是终稿

    转换时修订会被静默接受。需求说明书、投标文件、制度文件常常带着一堆没处理的修订,先在 Word 里接受或拒绝,Markdown 才是你想发布的那一版。

  5. 想清楚图片怎么放

    默认图片单独存成 media/ 里的文件、正文用相对路径引用,下载时选「.md + 图片」一起带走;要提交到 Git 仓库或贴进语雀、飞书,这也是最省事的形态。只有需要单文件时才切到 base64 内联。

转出来之后放哪里

转换只是一半,导出格式才决定这份 Markdown 到了目的地能不能直接用。

干净 Markdown
只有正文,没有多余标记。贴进语雀、飞书文档、Issue 或 PR 最合适。
Obsidian 笔记
带 frontmatter、目录和块 ID,一份需求文档转完就是一条能被引用的笔记。
GitHub / MkDocs
带 frontmatter、稳定的标题锚点和来源注释,适合多人协作的文档站。
RAG 分块
JSONL 分块并保留标题上下文,把 Word 文档喂给检索管线时不丢结构。

四种都跑在同一次本地转换上。带坐标的来源映射仍然只属于 PDF——.docx 里根本没有页面坐标可以映射。 查看全部输出格式

Word 和 PDF,该转哪个

两个都有就转 .docx。word转markdown 是从真实结构出发的:Word 文件里还保存着标题样式、编号、单元格、脚注关系。同一份文件导出的 PDF 只剩下坐标上的字形,所有结构都得靠位置和字号反推回来。

例外是这份文档只有 PDF,或者版面本身就是内容:扫描件、双栏论文、跨页的财报表格。那种情况请走 PDF 这条线。

word转markdown 常见问题

我的 Word 文档会被上传吗?

不会。word转markdown 全程在你的浏览器里完成:.docx 在本地解压、解析、转成 Markdown。断网也能用。没有账号、没有排队、服务器上也没有副本。

和用 pandoc 转有什么区别?

pandoc 很好,输出质量相当,但它是命令行工具,而且不会告诉你丢了什么。这个页面补的是它前面那一步:转完先看审计,知道哪几处需要手工补。

支持 .doc 吗?

不支持。老的二进制 .doc 不是 zip + XML,读不了。请先用 Word、WPS 或 LibreOffice 另存为 .docx。

Word 里的图片怎么处理?

word转markdown 默认把每张图片导出成 media/ 里的文件,正文只留一行 `![alt](media/image1.png)`,因为一张照片转成 base64 就是几万个字符,正文会被淹掉、diff 也没法看。下载时选「.md + 图片」,两者一起打包成 zip;需要单文件再切到 base64 内联,不要图片就选「不要图片」。

表格能保留吗?

能,转成 GFM 表格。但 Markdown 表格没有合并单元格,遇到合并会补空并在审计里标成「已降级」,而不是悄悄把你的数据重排。

为什么审计说公式「丢弃」了?

Word 用 OMML 这种微软自家的 XML 存公式,Markdown 没有对应写法。与其塞一个看起来像内容的占位符,不如如实报出数量,让你自己改成 LaTeX。

现在转一份 Word 文档

免费、本地、不用注册。这个 word转markdown 工具把审计算作免费转换的一部分,不是增值项。