我受够了 AI 做 PPT 像开盲盒,于是开源了一个「视觉演示锻造炉」
这段时间,我一直在折腾一件事:
能不能让 AI 做出来的 PPT,不再像开盲盒?
第一页是科技发布会,第二页突然变成咨询公司报告,第三页开始赛博朋克,第四页又像电商详情页。
单独看,每一页可能都“还不错”。
放在一起,却完全不像一套作品。
后来我越来越确定:AI 做 PPT 最大的问题,从来不是“能不能生成一张好看的图”,而是——
能不能让十几页内容始终生活在同一个视觉世界里。
于是,我把自己这套风格驱动、逐页生成、统一审核的工作流重新整理了一遍,做成了一个可以复用的 Codex Skill,并正式开源。
它叫:
Image 2 Deck Forge
中文可以理解为:视觉演示锻造炉。
项目地址:
https://github.com/lp7743951-star/image2-deck-forge
如果你也经常需要把文章、方案、研究报告或产品文档做成 PPT,欢迎直接拿去用。
它到底解决什么问题?
传统的 AI PPT,通常是先找一个模板,再把文字塞进去。
Image 2 Deck Forge 走的是另一条路线:
先理解内容,再选择风格;先锁定视觉规则,再逐页生成。
它会先从原始材料中提炼:
然后为整套 PPT 建立一份完整的 Style Lock。
这份 Style Lock 不只是几个颜色关键词,而是包括:
简单来说,它不是告诉 AI“做得高级一点”。
而是告诉 AI:
这一整套演示应该如何思考、如何构图,以及绝对不能变成什么样。
五套风格,不是五套换色模板
目前项目内置了五套视觉系统。
它们不是在同一个模板上换颜色,而是五种完全不同的视觉语言。
01|Terminal Tech Magazine
终端科技杂志
这套风格适合:
它的核心是近黑色终端表面、薄荷与青色信号、克制的技术几何。
我刻意限制了霓虹灯、代码墙、游戏 HUD 和赛博朋克噪声。
因为真正可信的技术感,应该来自结构和信息,而不是在画面里堆一百条发光线。
02|Impact Grid Editorial
影响力网格编辑
这套风格适合:
暖白纸张、黑色编辑网格、深青色模块,再配合具有证据感的纪实影像。
它追求的不是“花哨”,而是让一个观点即使缩小成缩略图,仍然有力量。
03|Climate Impact Editorial Grid
气候影响力编辑网格
这套风格专门面向:
它使用冷白纸张、低饱和环境摄影、海玻璃青和严格的瑞士网格。
同时明确禁止叶子图标、发光地球、过度鲜艳的绿色,以及一眼就能看出是“为了环保而环保”的装饰。
环境视觉应该来自证据,而不是来自绿色滤镜。
04|French Editorial Commerce
法式商业编辑
这套风格适合:
奶油色纸张、窄体大标题、衬线字体、酒红与焦糖色,以及带有胶片触感的产品影像。
它想实现的是一种“先像杂志,再像商业介绍”的感觉。
有欲望、有品位,但不靠大面积金色和廉价的奢华符号。
05|Aubergine Semantic Future
紫茄语义未来
这是这次重构加入的主打新风格。
深紫茄色背景、象牙白与淡金文字、纪念碑式大标题,以及一张真正由页面命题决定的主视觉。
它最重要的规则不是颜色,而是:
先理解这页在说什么,再决定应该出现什么图。
如果页面讲选择,可以使用岔路、门廊或分支结构。
如果页面讲协同,可以使用群体、连接或共同建造。
如果页面讲系统演化,可以使用生长、层叠、适应性建筑或自然结构。
只有当机器人真的与内容有关时,机器人才应该出现。
默认情况下,机器人和机械手图片不能超过整套演示的 20%。
因为“未来”不应该永远等于一只发光的机械手。
它是怎么工作的?
Image 2 Deck Forge 的完整流程大致如下:
原始文档
↓
提炼受众、目标、论点与证据
↓
选择一套视觉系统
↓
规划每页的页面类型与核心命题
↓
生成 outline.md 与 prompts.md
↓
先审核缩略图板
↓
逐页生成独立的 16:9 幻灯片图片
↓
修改不合格页面
↓
组装 image-only PPTX
这里有几个我非常看重的原则。
第一,一页只讲一个核心命题
不是把原文切成十几段,然后分别贴到页面上。
每一页都必须回答一个问题,或者推动一个观点。
第二,先审核,再批量生成
多页演示在正式出图之前,会先形成大纲、页面角色、Style Lock 和 prompts。
必要时还会先生成一张缩略图板,用来观察整套演示的节奏和一致性。
这样可以在成本最低的时候发现问题。
第三,一页一张完整图片
最终每一页都是一张完整的 16:9 图片。
PPTX 只负责忠实承载这些已经审核通过的页面,不再进行二次布局。
这意味着最终文件不强调元素级编辑,而强调视觉还原度和跨设备一致性。
第四,返修单页,不污染全局
如果第 7 页有问题,只重写第 7 页 prompt、重新生成第 7 页。
其他已经通过的页面保持不动。
返修必须继承原来的 Style Lock,不能修着修着换了一套设计。
如何安装?
项目地址:
https://github.com/lp7743951-star/image2-deck-forge
首先克隆仓库:
git clone https://github.com/lp7743951-star/image2-deck-forge.git
macOS / Linux
将 Skill 复制到 Codex skills 目录:
cp -R image2-deck-forge/skills/image2-deck-forge ~/.codex/skills/
Windows PowerShell
Copy-Item-Recurse .\image2-deck-forge\skills\image2-deck-forge"$env:USERPROFILE\.codex\skills\"
安装完成后,重新打开或刷新 Codex,让它加载新的 Skill。
如何使用?
最简单的方式,就是直接在对话里点名调用:
使用 $image2-deck-forge,
把这份战略文档做成 12 页图片型 PPT。
指定风格:
使用 $image2-deck-forge,
采用 Aubergine Semantic Future 风格,
把这篇文章做成 10 页演示,
先给我看大纲和缩略图板。
让它自动选风格:
使用 $image2-deck-forge,
分析这份材料并选择最匹配的内置风格。
先输出 outline.md 和 prompts.md,
我确认后再生成页面。
修改其中一页:
继续使用当前 Style Lock。
只修改第 6 页:
主标题不变,减少文字,
把装饰性机器人换成能表达“协同”的真实场景。
其他页面不要动。
查看五套内置风格:
使用 $image2-deck-forge,
列出全部内置风格,
说明每套风格适合什么内容,以及不适合什么内容。
你也可以扩展自己的风格
这个项目并不是只提供五套固定风格。
你可以复制任意一个现有风格文件,然后定义自己的:
写完后加入风格目录,再运行内置校验:
python skills/image2-deck-forge/scripts/validate_style_library.py
校验通过,就拥有了一套可以长期复用的视觉系统。
为什么选择开源?
因为我越来越觉得,AI 时代真正有价值的东西,不只是某一次生成出来的结果。
更重要的是:
所以我把这套工作流重新整理、脱敏、重构,并以 MIT License 开源。
你可以拿去使用、修改、Fork,也可以增加属于自己的视觉风格。
项目中已经附带:
写在最后
我不敢说它可以解决所有 PPT 问题。
但至少,它解决了一个一直让我很难受的问题:
让 AI 做出来的每一页,不再各自精彩,而是共同完成一套作品。
如果你正好需要把长文、方案、报告或产品材料做成视觉演示,可以试一试。
项目地址:
https://github.com/lp7743951-star/image2-deck-forge
如果这个项目对你有帮助,欢迎点一个 Star。
如果你做出了新的风格,也欢迎提 Issue、提交 PR,或者把效果发给我看看。
希望这个小小的“视觉演示锻造炉”,能让更多好内容被真正看见。