合作伙伴发来一份方案 PPT。你想让 Claude 帮你提炼重点,于是顺手用 MarkItDown 把它转成 Markdown,整段喂了过去。
几秒后,AI 给你一份条理清晰的分析。客户画像、解决方案、报价逻辑,一项不缺。
只有一个问题——它把那张架构图读成了“客户、平台、数据”三个散字,就凭这三个词,编出了一整套逻辑。
文字都在。意思全错。最可怕的是,它表现得像真的读懂了。
这不是 AI 笨,是你递过去的“文档”已经不是文档
PPT 里那些东西——左右分栏、时间线的先后、架构图谁指向谁——看着是排版,其实是逻辑。
当 MarkItDown 把一页 PPT 揉成一段流水文字,丢掉的不是美观。是这句话的语法。就像有人把“我打了她”的主语宾语打乱重排,你再努力读,读出来的也是个假故事。
AI 把架构图读成散字,不是它眼神不好。是你递过去的那个文件,已经不配叫“文档”了。它是一具被抽干了结构的文字尸体。
复杂文档里,版面本身就是语义。这一条没人提,但它是所有翻车的根。
MarkItDown 不是烂,是用错了地方
先把话说清楚。MarkItDown 不该背全锅。
微软官方出品,普通 Word、网页、线性排版的 PDF,用它转又快又准。它的设计目标本来就是“格式转换 + 文字抽取”,线性文档它是一把好手。
分水岭在“视觉复杂”四个字。一旦碰到 PPT、销售 deck、带图表的白皮书、课程资料,它就开始力不从心:
这些乱文本再喂给 AI,AI 就会把它们当真相。它不会告诉你“这里我看不懂”,它只会自信地编下去。
这才是真正危险的地方——不是文档转不出来。是转出来了,但是错的。

有个开源 Skill,思路反过来了
最近在GitHub 上发现有个项目叫 ky-markdown-rebuilder,是个装在 Codex 或 Claude Code 里用的 Skill。
它的做法不是“转格式”,是“重建”。流程分三步。
第一步,先用 MarkItDown 抽一份原始文本——不重复造轮子,该用微软的就用。
第二步,把原文件渲染成一页一页的截图。PDF 直接渲染,PPT 先转 PDF 再渲染,长截图直接用。
第三步,对着这些截图的真实版面,重新整理 Markdown。
重点是第二步。它把每一页的视觉版面当成了“真相源”。AI 不再对着散乱文字猜结构,而是“看着原页”重新组织。
思路一变,问题就变了:从“怎么把文字抽得更准”,变成“怎么让 AI 看见这一页长什么样”。
它能做到什么程度
下面这些不是宣传话术,是它 SKILL.md 里白纸黑字写的规则。
按页还原。 每一页单独成节,相邻页面不揉在一起。这条听着简单,但 MarkItDown 最容易栽的就是把两页内容混进同一段。
按视觉关系整理。 左右栏归左右栏,卡片归卡片,流程图按箭头方向走,时间线按先后排,对比矩阵做成表格。架构图不会再被拆成几个散词。
四种输出模式。 fast 给线性文本快速过;page-aligned 是默认,按页对齐;deep-visual 给信息密度高的页面,专门检查布局、图表、模块关系;reading 生成可读文章版——但有条硬规矩,reading 必须基于校准后的 Markdown 生成,不能直接拿乱序文本硬总结,否则就是错上加错。
六类文档路由。 PPT 走 deck,报告白皮书走 report,Excel 含图表会自动升级成视觉处理,长截图走 image,网页走 html,多形态混合走 mixed。按文档实际结构路由,不只看扩展名——因为同一个 xlsx,有的就是表格,有的其实是仪表盘。
自带质量门。 每页要有页面用途、布局图、区域分组、视觉关系说明。还有条硬规矩——读不清的小字、看不懂的图标,要么标“不可靠”,要么干脆不写,绝不编。
最后这一条,是它和那些“无脑 OCR 填充”工具最大的区别。
实测:初中化学课本那页
作者自己用了两个素材做测试。一个是初中化学课本,一个是当天合作伙伴发来的 PPT。
化学课本那页很典型——左边是实验步骤,右边是现象记录,中间一张装置图。MarkItDown 转出来,大概是“把硫酸倒入烧杯,观察到蓝色沉淀,图 2-3 是实验装置”。文字全在,但哪个现象对应哪一步、装置图里标了什么,全乱了。
重建之后,步骤归步骤,现象归现象,装置图单独有一段说明。一个初中生能看懂,一个 AI 也能看懂。

一行命令装上
Claude Code 用户:
mkdir -p ~/.claude/skillsgit clone https://github.com/KyrieCheungYep/ky-markdown-rebuilder.git ~/.claude/skills/ky-markdown-rebuilder
Codex 用户把路径换成 ~/.codex/skills 即可。
装好之后,直接点名触发:
/ky-markdown-rebuilder 帮我把这个 xxx 这个文档 做成 Markdown


首次执行时会花费一些时间安装一些缺少的依赖。默认产出 source.calibrated.md。还想要大纲,会额外生成 source.outline.md——而且这个大纲是从校准后的 Markdown 提炼的,不是从乱序原文硬编的。
真正的意义,是把文档变成资产
装这个 Skill,多一个转换器只是顺手。
更值的是——你手里那些 PDF 报告、方案 deck、课程资料,原本是“看一遍就扔”的视觉文档,现在第一次变成了能被 AI 反复读取、能被你重新拼接的结构化资产。未来更能能够将它作为只是沉淀下来作为自己的永久资产!
一份规整的 Markdown 摆在那里,AI 才能真正帮上忙。而不是一本正经地帮倒忙。
下次再有人给你发 PPT,别让 AI 对着一堆散字编故事了。让它看着原页读。