
嗨,大家好,我是二毛!
前天晚上我在整理一堆项目资料。十几份 Word、几个 PDF,还有两张表格。我想把它们全丢进 Claude 里问问题。结果一复制粘贴,格式全糊了,表格变成一串乱码,标题层级也丢了。
我之前一直用手工粘。粘完还得自己一点点改成 Markdown。那天实在忍不了,去翻了翻有没有现成解法。然后就撞见了 MarkItDown。
MarkItDown

MarkItDown 是微软在 GitHub 上开源的一个小工具,纯 Python 写的。2024 年 11 月 14 号第一次提交,到现在 309 次提交,最新版 0.1.6 是今年 5 月底刚发的。维护者名单里能看到 Adam Fourney 这种微软的人。
它只干一件事,把各种各样的文件,转成 Markdown。
为啥微软要搞这个?因为它本来就不是给普通读者准备的,是给 AI 管线准备的。大模型吃文本,最怕格式脏、结构丢。MarkItDown 就是把乱七八糟的源文件,规整成模型好消化的干净 Markdown。官方定位也写得很直白,注重保留结构,不追求高保真的人类阅读还原。
注意它转出来的 Markdown 主要是给大语言模型看的,不是给人精读排版的。它保的是结构,标题、列表、表格、链接这些,原样留着。这点得先说清楚,不然你拿它去还原一份精美海报,会失望。

它支持的格式挺广的。PDF、PPT、Word、Excel 这些办公三件套自不必说。图片也能支持,能读 EXIF 元数据,还能 OCR 把图里字抠出来。音频也行,能把语音转写成文字。HTML、CSV、JSON、XML 这种文本格式更不在话下。
连 ZIP 压缩包它都会自己解开遍历,YouTube 链接、EPub 电子书也支持。
我试了下把一份带表格的产品需求文档丢进去。出来的 .md 里表格还是表格,结构保持都一样。

这工具最大的价值,是给 AI 喂料,因为现在基本上办公都是AI,但是AI的幻觉有比较严重,干净的资料就是解决幻觉的最好方式。
如果你做 RAG、搭知识库,或者就想把一份合同丢给 GPT 问条款,都得先把文件变成模型能读的干净文本。以前这步要么手工来,要么上贵得要命的云 API。MarkItDown 一条命令搞定,还开源免费。
我算过一笔账,一份二十页的产品文档,手工粘进 Obsidian 再调格式,快则半小时,慢则一下午。换成它,敲一行命令,咖啡还没凉就好。
它不像有些工具追求把版面一分不差还原给你看。它要的是结构对、文字全、能喂模型。这个取舍,对搞 AI 的人来说刚刚好。
怎么上手,一行代码就能够解决,
pip install 'markitdown[all]'
只想转某几种格式,也能按需装,
pip install 'markitdown[pdf, docx, pptx]',别把用不上的依赖全拽下来。
转文件更简单,命令行敲,
markitdown 你的文件.pdf > 输出.md
不想写文件,管道也行,cat 文件.pdf | markitdown。
会 Python 的话,几行就能嵌进自己的脚本,
如果不会用代码的话,我这里还有windows的版本。
如果你是跟 AI 打交道、搞数据的,或者天天跟一堆格式乱七八糟的文档打交道想喂给模型,这玩意儿基本是刚需。我现在的流程就是资料丢进去,出来 .md 直接进 Obsidian 当素材。
反正微软开源的,不要钱,提交也一直没停过。你要常跟文档和 AI 打交道,值得顺手装一个。
觉得有用的话,别忘了点赞、在看、转发给身边需要的朋友!