Codex PPT Skill:把文章生成成图片式 PPT
- 2026-09-24 02:09:08

AI技能图鉴 / AI SKILL ATLAS
ARCHIVE 026 · CODEX PPT
FIELD GUIDE/OPEN SOURCE/CODEX SKILL
Codex PPT Skill:把文章生成成图片式 PPT

分类:Presentation / 图片式 PPT 生成与阶段化交付
来源:https://github.com/ningzimu/codex-ppt-skill
CATALOG / 目录
PHASE00
先确认内容与方向
·内容拆解与大纲确认
·风格、后端与样张确认
PHASE01
逐页生成并约束资产
·逐页生图与子 Agent 调度
·严格输入资产与个人风格库
PHASE02
组装与交付检查
·演讲稿与 PPTX 组装
·QA、修复与结果记录
很多 AI PPT 工具都会把结果保存为.pptx格式。但文件后缀相同,内部结构不一定相同:有的工具生成的是一组可以分别编辑的文字、图表和形状;有的工具只是把每一页做成一张完整图片,再放进幻灯片里。
ningzimu/codex-ppt-skill采用后一种方式。它把文章、报告、论文、笔记或大纲转成视觉统一的图片式演示文稿,再组装成 PPTX。这套 Skill 的定位很明确:它擅长内容拆页、视觉方向确认、逐页生图和交付检查;但如果生成后还需要逐个编辑文本框和图表,它就不太适合。
Skill 分类: 图片式 PPT 生成与阶段化交付 SkillGitHub: https://github.com/ningzimu/codex-ppt-skill先说结论: 这套 Skill 的价值不在于让 Agent 一句话生成 PPT,而在于先确认内容、风格、生图后端和单页样张,再批量生成整页图片、做 QA、写演讲稿,最后组装成 PPTX。
关注AI技能图鉴,持续介绍AI技能
它解决什么问题
CASE 01
先把“PPTX”与“可编辑”分开
项目的SKILL.md直接写明:每一页最终都会是一张完整的 16:9 图片,assemble_ppt.py再把这些图片组装成.pptx。因此,拿到文件后可以用 PowerPoint 打开、播放并添加备注,但页面里的标题、段落、图表和装饰不会因为文件后缀是 PPTX 而自动变成一组可以分别编辑的元素。
这意味着,它更适合需要一套视觉统一的演示稿,而不是需要反复修改数据、文案和布局的原生 PowerPoint 文件。若团队的交付要求是“每个文本框都能继续编辑”,这套 Skill 就不是合适的选择。
CASE 02
把“做 PPT”从一次生成改成几个确认门
普通的生成式流程往往是把材料交给 Agent,等它一次生成整套页面。问题在于,方向一旦错了,返工就不只是改一句话,而可能要重做多页图片。codex-ppt-skill把读取素材、确认逐页大纲、视觉风格、生图后端和单页样张拆成几个连续步骤,每一步确认后再进入下一步。
这是根据流程设计作出的判断,不是项目对效率的承诺:尽量在批量生成前暴露问题,通常比整套生成后才发现风格不对更容易处理。
CASE 03
让论文图、截图和 Logo 真正进入页面
如果演示稿依赖论文原图、实验结果图表、产品截图或 Logo,最大的风险不是少一张配图,而是数据、标签或坐标轴被改错。项目把这类用户提供的文件视为严格输入资产,要求在大纲中写清它们出现在哪些页面、承担什么用途,并在生成时保留原图中的数据和标注。
6 个核心能力,分别怎么用
先说明一个容易混淆的地方:仓库正式发布的是一个codex-pptSkill。为便于理解,下面把这套工作流拆成六个阶段;它们不是六个可以分别安装的 Skill。

从材料到图片式 PPTX:每一步先有可确认的产物,再进入下一步。
内容拆解与大纲确认
先决定每一页要讲什么
解决的问题: 原始文章通常按阅读顺序写,演示稿却要按屏幕节奏组织。一个段落该变成结论页、对比页、流程页还是案例页,不能等生图时临时决定。
调用示例:
请使用 codex-ppt skill,把这篇技术文章做成 10 页左右的分享 PPT。先读取全文,给出逐页大纲、每页标题、要点、版式角色和需要保留的原图,等我确认后再继续。输入: 文章、报告、论文、课程笔记或大纲,以及目标听众、页数和必须保留的内容。输出: 经确认的outline.md,里面写清每页标题、要点、版式角色和必需图片。不会自动发生: Skill 不会在大纲确认前自动创建最终的deck_spec.json、生图任务、页面图片或.pptx。
风格、后端与样张确认
先验证一页,再决定是否批量
解决的问题: “科技感”“简洁”“像某份参考 PPT”都太宽泛。真正影响成品的是配色、字体、信息密度、版式节奏,以及当前环境到底能调用哪一种生图方式。
调用示例:
大纲确认了。请给出 3 个具体视觉方向,说明各自适合的场景;我选定后,再告诉我将使用的生图后端,并只生成第 3 页作为样张,等我批准。输入: 已批准的大纲、品牌或参考图、希望的视觉方向,以及当前 Agent 能使用的图片工具。输出: 风格选择、后端选择和一张代表性样张。项目文档要求在首次生图前说明后端,确认后保持不变。不会自动发生: Skill 不会因为选定了一个风格就直接批量生成整套页面;样张获批后,才会进入批量生成。
逐页生图与子 Agent 调度
把整套页面拆成可追踪的任务
解决的问题: 一套 PPT 往往有多页,每页的标题、重点和视觉关系不同。项目要求每一页最终图片都由已确认的生图后端生成;样张获批后,再把剩余页面拆成单页任务。
调用示例:
样张通过了。请按已确认的后端生成剩余页面,每页一个任务,保留同一套视觉风格,并记录每页的派发和生成结果。输入: 已批准的大纲、风格、后端、样张和逐页提示词。输出:origin_image/slide_XX.png,以及记录任务状态的slide_jobs.json和slide_run_state.json。如果运行环境支持子 Agent,剩余页面会按一页一个子 Agent 的方式派发。不会自动发生: 生图后端确认后,Skill 不会自动改用另一种后端;遇到子 Agent、后端或其他必要条件不可用时,它会停在派发环节并报告阻塞。
严格输入资产与个人风格库
让参考材料有明确职责
解决的问题: 参考图不只是用来模仿风格的灵感图。论文曲线、实验柱状图、产品截图和 Logo 往往承担证据或识别功能,必须保留原始信息。
调用示例:
这两张图是论文结果图,必须原样出现在第 6 页和第 7 页。请在大纲中标明用途,生成时保留数据、坐标轴、标签和图例,不要重新绘制。输入: 用户提供的图表、截图、Logo,以及可复用的风格参考。输出: 一份标明页码与资产对应关系的大纲;如果保存过个人风格,风格文件位于CODEX_PPT_HOME或~/.codex-ppt-skill/references/,与 Skill 安装目录分开,更新或重装 Skill 时不会丢失。不会自动发生: Skill 不会把这些必需资产当成只供参考的灵感素材,也不会自行决定它们的页码和用途;这些信息需要在大纲中明确。
演讲稿与 PPTX 组装
把图片页变成可交付文件
解决的问题: 视觉页面只是演示的一部分。演讲者还需要一份按页编写的讲稿,最终文件也要按页码顺序组装。
调用示例:
请根据最终大纲为每页写中文演讲稿,使用 Slide N 标题;确认所有页面都已记录后,再把 origin_image 组装成 16:9 PPTX,并把演讲稿写入备注区。输入: 已通过 QA 的origin_image/slide_XX.png、最终大纲和speech.md。输出:.pptx文件;assemble_ppt.py会把整页图片铺满空白幻灯片,并可把speech.md的内容写入对应的备注区。不会自动发生: Skill 组装出的 PPTX 不会把整页图片拆成可编辑的文本框、图表和形状。
QA、修复与结果记录
检查完成,不是口头宣布完成
解决的问题: 生成的页面容易出现文字模糊、标题被截断、信息溢出、风格漂移或元素重叠。项目把这些检查安排在组装前,并要求用脚本记录结果。
调用示例:
请逐页检查文字清晰度、内容是否对应大纲、是否有截断、溢出、重叠、意外页码和风格不一致;需要修复的页面重新生成,确认所有状态为 recorded 后再组装。输入: 全部页面图片、已确认的大纲、样张和任务状态。输出: QA 结果、必要的修复页面,以及可追踪的派发和结果记录。不会自动发生: Skill 不会把组装脚本运行成功当作视觉质量合格;只要还有页面处于pending、dispatched或blocked状态,就不会标记整套 PPT 已完成。
最常见的使用方式
把一篇文章做成技术分享
先把文章交给 Agent,限定听众和大致页数,让它产出逐页大纲。确认后选择视觉方向和生图后端,再生成一页样张。样张通过后,继续生成剩余页面,逐页检查、补写演讲稿,最后组装成 PPTX。
这条路径适合内容已经成型、但还没有演示结构的场景。关键不是把文章机械地切成十页,而是让每页承担一个明确的讲解任务。
把论文或报告做成答辩稿
第一次调用时,先列出必需保留的论文图、实验图和 Logo,并把它们对应到具体页码。确认大纲时,逐张检查图片的用途;生成时要求保留数据、标签、坐标轴和图例;QA 时分别检查图片是否出现、内容是否被误改。
这条路径能发挥图片式 PPT 的一个优点:整套页面可以保持统一的视觉风格。但前提是输入资产准备充分,关键证据不能交给模型自由重绘。
只修一页,不重做整套
如果整套风格已经确认,只有某一页的内容、排版或配色不满意,就只修改这一页,并沿用已经确认的风格和后端。这样做的前提是保留原大纲、样张和任务记录,不要为了修一页顺手改变全局风格。
它为什么能工作
这套 Skill 的结构可以压缩成一条链:
材料与资产 → 逐页大纲 → 视觉风格 → 生图后端 → 单页样张 → 批量页面 → QA 与状态 → 演讲稿和 PPTX。
前半段解决“做什么”和“长什么样”,后半段解决“每页是否生成、是否合格、能否交付”。每个阶段都有一个可确认的产物:大纲是outline.md,页面任务有 JSON 文件,生成结果进入状态记录,最终组装只读取按页命名的图片。

仓库提供的示例页由完整页面图片组成:视觉成品清楚,但页面内容不会变成原生可编辑的单个元素。
这种设计的取舍很清楚:它以牺牲原生元素编辑能力为代价,换取整套页面的视觉一致性和流程可追踪性。最终效果仍取决于原始材料、提示词、后端能力和 QA,项目没有对生成速度或成功率作出统一承诺。
安装与前置条件
在 Codex 中,可以直接对 Agent 说:
请帮我安装这个 codex-ppt skill,链接是:https://github.com/ningzimu/codex-ppt-skill也可以手动安装到 Codex 全局 Skills 目录:
npx -y skills@latest add ningzimu/codex-ppt-skill \ --skill codex-ppt \ --agent codex \ --global安装完成后需要重启 Codex,让新 Skill 生效。
生图后端需要单独确认。项目优先使用 Agent 内置的图片生成能力,通常不需要用户手动准备 API key;如果内置工具不可用,或明确选择 CLI/API 回退模式,则需要按文档配置OPENAI_API_KEY,并可配置OPENAI_BASE_URL、CODEX_PPT_IMAGE_MODEL等环境变量。不能把“通常无需 key”理解成所有客户端、账号和后端都无需配置。
开始前至少准备好源材料、听众和页数,并列出需要保留的图表或截图。否则,确认的只是一个模糊方向。
限制与适用边界
这套 Skill 最需要提前想清楚的,是你对成品的期待。它交付的是由整页图片组成的 PPTX,适合直接演示,不适合会后再逐个修改文本框、图表或数据;交付规范要求原生 PowerPoint 元素时,应该换一条可编辑的流程。
它也不是把材料交进去就会一直跑到成品。生图后端和子 Agent 能否使用,要看当前环境;条件不够时,Skill 会停下来报告。论文图、实验图和产品截图也得在大纲里先写清楚放在哪一页、承担什么作用,不能只扔给模型当参考图。
最后还是要逐页看一遍。文字是否清楚、标题有没有被裁掉、图表和版式有没有跑偏,不能用脚本运行成功来替代检查。许可证是 MIT。软件按“现状”提供,具体生成结果是否够好、是否适合你的场景,项目不作保证。
适合谁
它适合需要把文章或报告变成技术分享的内容创作者,也适合要把课程笔记、产品介绍或调研材料整理成统一视觉稿的团队。手上有论文图表、希望先搭出答辩视觉框架的研究者,也可以使用。
它不适合把“后续编辑”放在第一位的人。如果你的工作重点是反复改数字、调整表格、替换每个文本框,或者交付规范明确要求原生 PowerPoint 元素,那么应优先选择原生可编辑的 PowerPoint 流程。判断它值不值得安装,先问自己一个问题:你要的是一套可以直接演示的完整画面,还是一份还要继续编辑的 PowerPoint?
关注AI技能图鉴,持续介绍AI技能