🎮 阅读原文:查看开源 PPT Skill
AI 做 PPT 这件事,最让人崩溃的时刻通常不在生成,而在生成之后。
领导看完第一页,说标题换个说法;客户临时改了一个数字;产品同学又塞进来一项功能。你打开那份“看起来很高级”的成品,才发现它只是一张大图。文字不能选,图表不能挪,连把一处错别字改掉都像在给海报做外科手术。
好看,一次性。能改,才是工作流。
GordenSuperPPTSkills 盯住的正是这件事。它先用 AI 生成信息密度高的图片型 PPT ,再把每页图片还原为可编辑的 PPTX 。重点不只是“导出一个 .pptx 后缀”,而是尽量把需要反复调整的内容拆出来:普通文字变成文本框,框架和图标作为可移动、可缩放、可替换的图层保留。

图片 PPT ,为什么总在最后一步卡住
图片型 PPT 其实不该被嫌弃。它有一个很大的优点: AI 对整页画面更有把握。复杂框架、异形卡片、装饰图标、层叠图表,放在一张图里生成,视觉完成度常常比“让 AI 一个个摆原生形状”高得多。
问题是,它像一张封口的便当盒。看着精致,饿的时候却打不开。
真正的业务场景不会给你“生成完就永远不改”的机会。数据会变,语气会变, logo 会变,甚至整页结构都会被临时加一条批注。于是很多所谓 AI PPT ,最后还是要回到人工重做。
这个仓库把流程拆成了三个独立 Skill :
•GordenImagePPTGen 负责生成每页图片和图片型 PPT 。•GordenImage2PPTX 负责把已有图片或截图还原成可编辑 PPTX 。•GordenSuperPPTSkill 把两段串起来,完成“先出图,再还原”。你也可以跳过第一段。手里已经有一套图片 PPT 、旧的汇报截图,直接交给 GordenImage2PPTX 转成可编辑版本就行。这一点很实用,它不是逼你从头换一套创作方式。
它不是简单 OCR ,而是把一页拆成四层
仓库的核心方法叫“四层还原”。一页看似复杂的 PPT ,被按从下到上的顺序拆开:背景图、整体框架图、图标与装饰、普通文本。

背景层负责底色、纹理和氛围;框架层负责卡片、标题条、分隔线、连接线,甚至图表的坐标网格、柱线和趋势线;图标和装饰单独处理;最后才把普通文字按原位置写回 PPT 文本框。
这顺序看着有点拧巴,但它避开了最常见的翻车方式:直接拿原图做底,再盖一层 OCR 文字。那样做的结果是双重文字,原图里的字还在,改动后的字又压上去,现场一片灾难。
仓库要求用图像生成能力分别复刻背景、框架和元素,再做透明抠图与定位。文本则通过视觉解析提取,写成真正能点开、能修改的文本框。

一句话总结:它不是把一张图“塞进 PPT”,而是把一张图拆开后再放回 PPT 。
“完全可编辑”到底能改到哪里
这四个字最容易被营销话术带偏,得掰开说。
在这个方案里,普通正文、标题、数字、标签等文字会还原为 PowerPoint 文本框。所以你可以直接改文案、改颜色、改字号、拉宽文本区域,临时替换数据也不用重新出一张整页图。
而复杂的视觉部分,比如异形卡片、背景纹理、图表骨架、特殊装饰,默认会作为透明的视觉图层留在 PPT 里。它们能整体移动、缩放、替换,也能和文字分开处理;但它们不一定自动变成每条线、每个圆角都能独立编辑的原生 PowerPoint Shape 。
这个边界反而诚实。要在“保持原图复杂视觉”与“全页都是原生形状”之间二选一,后者通常会牺牲还原度,还会把转换流程拖得很长。对大多数汇报场景而言,能改文字、能换图标、能移动整块框架,已经能处理九成临时需求。

如果你确实要把框架也拆成一块块单独拖动,仓库也支持在提示词里明确要求“切分框架”。只是组件越细,定位与校验越复杂,别为了追求一句“全原生”把可维护性弄丢。
它如何让还原别跑偏
把图片转回 PPT ,真正难的不是把字识别出来,而是让位置别漂。
仓库里有一套很细的约束:用源图的实际像素坐标来计算文本和元素位置;图标先放在纯色背景上提取,再抠成透明图;框架会保留成整张透明层,保证原本的卡片、线条和图表关系不散;合成后还会生成预览,与原图做并排图、叠图和差异热图检查。

这种“先拆层、再回放、最后对比”的笨功夫,才是可编辑 PPT 不至于变形的原因。 AI 负责视觉理解与生成,脚本负责抠图、定位、合成和 QA 。谁也别替谁硬扛。
哪些场景值得用
我会把它用在三种情况。
一是你已经有 AI 出的图片型 PPT ,视觉不想推倒重来,但必须交给别人继续修改。把文本层还原出来,后续协作立刻轻松很多。
二是你有一堆历史汇报截图。内容和结构已经存在,只是源文件丢了,或者原始 PPT 早就被压成图片。它可以作为一次“救回可编辑资产”的尝试。
三是需要高视觉密度的方案页。先让 AI 用整页画面解决布局与美术,再把可变的文字和元素交还给 PowerPoint 。这个顺序比一开始就逼 AI 拼原生 Shape 更符合当下模型的长处。
也要留意成本。仓库作者说明,图片转可编辑 PPTX 比直接生图更吃模型额度;以 Plus 订阅的估算,一张图片转换大约可能消耗 5 小时额度的 10%。页数多、框架复杂时,别一上来就拿 50 页年报去试,先挑一页典型页面跑通,确认文字、图层和版式满足要求再批量。
使用时,给 AI 一句明确的话
仓库面向 Codex 使用。生成全流程时,可以明确说:
使用 GordenSuperPPTSkill ,生成一份 N 页 PPT ,先生成图片型 PPT ,再转换为可编辑 PPTX ,要求文字可编辑、框架与图标可移动。
如果只需要救回已有图片,可以更直接:
把当前文件夹里的 XXX.png 使用 GordenImage2PPTX 还原成可编辑 PPT ,严格遵循四层流程。
别只说“帮我转 PPT”。把“文字可编辑”“框架要不要切分”“是否保留复杂视觉”写清楚,最终文件会少很多返工。
PPT 最有价值的时刻,从来不是发出去那一秒,而是第十次改标题、第三次换数据时,它还没散架。
开源仓库:https://github.com/GordenSun/GordenSuperPPTSkills[1]
作者说明:可商用使用需标明 GitHub 出处或作者 @Gorden Sun ;实际转换质量、模型额度与支持范围以仓库最新版文档为准。
参考链接
[1] https://github.com/GordenSun/GordenSuperPPTSkills: https://github.com/GordenSun/GordenSuperPPTSkills