两个月踩坑实录
好看只是及格线能不能改才是分水岭
从素材库到能交出去的 PPTX,我这条流水线跑了两个月。这篇把每一步、每个卡点、每条提示词都摊开,包括我一开始搞错的那几件事。
12 张图 · 8 条提示词面向零基础
两个月前,我把一份 AI 生成的 PPT 发给同事。
他回了五个字:这个改不了。
我打开一看,标题是图,正文是图,那个我想改的错别字,也是图。二十四页,没有一个能点进去的文本框。
那次之后我才认真琢磨这件事。这两个月我把这条路重新走了一遍,中间换过三套方案、烧掉不少生图额度、也把公司母版做废过一次。这篇就是这两个月的账。
面向完全没做过的人写,所以有些概念我会从头解释一遍。已经熟的可以跳着看图,每张图我都尽量做到脱离正文也能看懂。
图 1|判断一份 PPT 是不是"真的能改",有四条硬标准,最快的一条只要三秒
先说结论:分水岭不是好看,是能不能改
先给个能立刻用上的自测方法。
打开那份 PPT,鼠标点一下标题。光标能插进去、能选中单个字,那是真文本框。整块被选中、四周出现图片的控制点,那就是一张图。
三秒钟,比任何评测都准。
往深了说,业界现在判断"真可编辑"有四条标准,我把它们并成一张图放在上面:
第一,每段文字是独立的文本对象,可以选中、可以改字号,而不是画在图上的像素。
第二,每个图形是原生的形状、图表、连接线,而不是一张贴上去的矢量图或者截图。
第三,母版和版式还在。母版这个词后面我会专门解释,你先理解成"PPT 的底图"。
第四,文字有没有溢出,是用真实的字体宽度算出来的,不是靠猜。
四条里最要命的是第一条。整页出一张图塞进 PPT 这种做法,在圈内被明确归为不可编辑;先截个图当背景、再在上面叠一层文本框的,算"部分可编辑"——字能选中,但它是浮在图上的补丁,底下那张图纹丝不动。
我踩的第一个坑:把"生成"当成了全部
一开始我觉得图片式挺好的。
生图模型现在的审美确实比大部分人手搓的强,一句话出一页,视觉冲击力拉满。我拿它做过两版汇报材料,同事看完都说好看。
问题出在第三版。领导要改一个数字。
那一刻我才意识到,我交出去的不是 PPT,是二十四张海报的合订本。改一个数字,等于重画一张图,而重画的那张图和旁边二十三张的构图、光照、字重全对不上。
这不是某个工具的锅。GitHub 上有个四千多星的项目就是纯图片路线,说明书写得明明白白,人家从来没说自己能改。是我自己没分清"生成"和"交付"是两件事。
后来我在另一个项目的 issue 区看到有人专门开需求,标题就叫「图片转可编辑 PPT 做成独立功能」。你看,掉进同一个坑的不止我一个。
图 2|同一页 PPT,三种做法交出来的东西完全不同:图片式只有一层,网页式压根不是 PPTX
打开 AI 之前,胜负已经定了一半
这一节可能是全文最反直觉的。
新手默认 PPT 是"打开工具开始做",老手知道 PPT 是"把手上的料摆出来"。做得快不快、好不好,八成取决于你动手之前手里有没有东西。
我一开始的素材库就是个收藏夹。看到好文章存一下,看到好图存一下,两个月存了几百条。真到做 PPT 的时候,我在里面翻了四十分钟,一条都没用上。
原因很简单:收藏的是别人的成品,我需要的是能拆下来用的零件。
后来我把素材库改成了四层。
第一层,原始材料。原文、原图、原始数据,一个字不改地存着。它的唯一职责是可追溯——将来有人问"这个数字哪来的",你能翻出来。
第二层,结构化笔记。这是最关键的一层,也是大部分人缺的一层。一份材料进来,我会把它拆成三份:一句能当结论用的话、支撑这句话的证据、以及这个概念该长成什么样的图形。拆完各归各位。没拆解过的材料不许进这一层。
第三层,可复用的视觉组件。用过一次觉得好的版式、配色、图表样式,单独存下来。下次遇到同类内容直接调。
第四层,母版和品牌资产。公司模板、字体、Logo 规范。这层最少动,但最不能丢。
判断一条素材该不该进库,我只问一句:将来我会以什么形式把它取出来?答不上来的,就是收藏夹里的又一条尸体。
图 3|素材库不是文件夹堆文件。判断进不进库,就问一句"将来我怎么把它取出来"
别手搓,已经有人把轮子造好了
这条赛道的成熟度,超出我一开始的想象。
我把 GitHub 上做 PPT 的项目挨个翻了一遍,数据是这两天现查的:最大的一个四万四千多星,还在天天提交;做 Office 文件命令行工具的那个两万七千多星;我最后用上的那套 skill 是四千九百多星。这不是什么冷门方向,是已经卷起来的赛道。
我最后选了两个东西,各管一段。
一个负责做稿和视觉。这是一套开源的 skill,装进本地 agent 就能用,自带十二套视觉主题、一千零二十个版式页面、八千五百七十六个可调控件。你不用懂设计,选个主题,剩下的它铺。生成完可以在浏览器里直接改,改完导出 PPTX。
另一个负责出厂体检和定点修补。是个单文件的命令行工具,不用装 Office 就能读写 .docx、.xlsx、.pptx。它的价值不在生成,在"检查"——一份 PPT 做完了,它能告诉你结构对不对、有没有隐藏的问题、文件本身合不合规范。
这里插一个我搞错的事。我一度以为这个命令行工具是微软官方开源的,还挺放心地装了。后来查了一眼仓库归属,发现根本不是微软,是另一个团队做的,开源协议也不一样。
工具本身没问题,我现在还在用。但这件事提醒我一个习惯:装任何工具之前,花十秒看一眼它的归属和最近一次更新时间。这两个信息能挡掉八成的坑。
图 4|横轴是产物能不能改,纵轴是项目还活不活跃。挑工具先看右上角
选主题这件事,我建议你直接看图。下面这四套是我用得最多的,风格差别很大,实际感受一下比听我描述有用:
图 5|十二套主题里的四套内页实拍。一千多个版式的意思是,绝大多数内容你都能找到装得下的格子
反直觉的一步:先画一张"假 PPT"
这一节是我这两个月最大的收获。
新手的流程是:写内容 → 让 AI 出 PPT → 觉得不好看 → 反复调。我卡在这个循环里很久,每次都在调,每次都差点意思。
后来我改了顺序:内容定稿之后、动手做之前,先用生图模型把这一页画出来。
画出来的这张图不能改字、不能编辑,纯粹是一张图。但它不是配图,它是这一页的验收标准。有了它,后面所有工作变成了"照着这张图,用可编辑的对象把它复刻出来"。
差别在哪?
没有这张图的时候,你和 AI 都在猜"好看应该是什么样",猜的过程就是反复返工。有了这张图,目标从模糊的审美判断变成了明确的复刻任务。而复刻这件事,AI 干得非常好。
我给这张图起名叫锚点稿。它有几个硬性要求:
必须 4K,3840×2160。低了看不清细节,复刻的时候没法对齐。
必须真 16:9。和目标 PPT 同比例,否则复刻出来构图全变。
必须整页画,不是画一个元素。标题在哪、留白多少、几个模块怎么排,都要在这张图里定死。
至于提示词怎么写,我把自己的模板整个拆开放在下面。这套结构我改了十几版,现在稳定在十三段:
图 6|生图提示词的十三段结构。标红那段是全篇最关键的,下一节专门讲
逐段说明一下,你可以直接照着填:
用途和资产类型。开头就说清楚这是什么,比如"一张信息密度高的 16:9 演示文稿关键页"。别让模型猜。
参考图的角色。如果你给了风格参考图,必须明写"只参考什么、不要复用什么"。我的原话一般是这样:只参考它的底色、光线语言、材质质感和中文字体效果,不要复用它的布局、标签和模块结构。不写这句,模型会把参考图整个抄一遍。
这一页要讲什么。一句话说清,并且要包含"这页必须同时出现哪几个东西"。
场景描述。如果有场景,写清楚。可信、有张力,但别夸张。
版式分区。这段我用百分比切:顶部 14% 放标题,上面三分之二放主流程,下面三分之一放状态图。给具体数字,模型的执行力会好很多。
核心逻辑。这页要表达的硬逻辑写清楚。比如一个状态机,正常路径是什么,超时走哪儿,报错走哪儿,哪个状态不许自动重试。
视觉调性。高级、克制、信息图风格,或者别的什么,说清楚。
配色。这段的关键不是列色号,是给颜色分配语义。我一般这么写:琥珀色代表人的决策权,青绿色代表本地安全动作,珊瑚红只给风险和失败,米白色给文字。分配了语义,模型画出来的图才有逻辑,不是好看的色块。
逐字文案清单。下一节专门讲,全篇最重要的一段。
字体要求。粗体现代中文无衬线,字号要能投影看清,不要小段落正文。
禁止清单。不要 Logo、不要商标、不要编造的数字、不要水印、不要多余文字、不要通用软件仪表盘的样子。这段能挡掉大量翻车。
修正提示词。单独准备一段,专门用来改文字,后面细说。
验收重点。你自己看图时要检查什么,写下来,避免看着好看就通过了。
生图模型写中文必错,得靠锁字
这是我烧掉最多额度才明白的一件事。
生图模型画中文,几乎必错。少笔画、多笔画、生造字、同一句话渲染两遍,什么都有。这不是提示词写得不够好,是模型能力的边界。
我一开始的做法是反复改提示词,把要求写得越来越详细。没用。改到第五版,字还是错的。
正解是在提示词里单独开一段,把图上要出现的每一句中文逐字列出来,并且明确要求每条只渲染一次。
写法大概是这样:
Text (verbatim, render each exactly once):"风突然起来,系统怎么不乱""风险进入""冲突重排""人车机分工""回执对账""UNKNOWN ≠ FAILED""禁止自动重发"
两个细节容易漏掉。
一是必须逐字列,不能概括。写"标题写风险处理流程"没用,得把那七个字原样写出来。
二是必须锁定出现次数。不加"每条只渲染一次",模型很喜欢把同一句话在图上画两遍,一个在标题位,一个在角落里。
加了这段之后,我的一次成功率从大概三成提到八成以上。剩下那两成,靠下一节的办法收拾。
图 7|同一段需求,左边没写逐字清单,右边写了。红圈是错字和重复渲染的地方
字错了别重画,发第二轮
剩下那两成怎么办?
新手的本能反应是:图上有个错字,让模型重新生成一张。
千万别。
重新生成意味着模型重新构图。你会得到一张文字对了、但布局变了、光照变了、箭头位置也变了的新图。而你原本只想改两个字。我最惨的一次连改三轮,越改越不像,最后回头去翻第一版。
正确做法是发第二轮,而且这一轮只动文字。
我固定用的修正提示词是这样:
只改文字和标签,保持整个构图、光照、物体、箭头和配色系统不变。允许出现的文字只有以下这些:[把逐字清单原样再贴一遍]每条只渲染一次。删掉其他所有文字。别的什么都不要改。
关键在"别的什么都不要改"这句。它把构图锁死,模型只在文字层动手。
这条经验值多少钱?我算过,按我前期的返工频率,光这一条每个月能省掉几十次无效生成。
图 8|同一张锚点稿的两轮。中间那步只替换文字,构图、光照、配色全部锁死
锚点稿定下来之后,还有一步别忘了:把它拆解回素材库。
这张图的配色语义、版式分区、信息层级、图形语言,都是你花钱买来的资产。拆下来存进第三层,下次做同类页面直接调,不用从头试。我现在大概攒了三十多套,新页面的锚点稿命中率越来越高。
三条路怎么选:主题、母版、还是重做
锚点稿有了,接下来是把它变成能编辑的 PPT。
这里有三条路,选错了后面全是返工。
第一条,用现成主题。没有公司模板要求,就选一套主题,让它按版式铺。最省事,成品度也够,我自己八成的场合走这条。
第二条,跟随公司母版。有公司模板必须走这条。
第三条,原生重做。现成版式装不下你那张锚点稿的时候走这条,用程序化的方式直接生成 PPT 对象。
先解释母版是什么,因为这是新手最容易吃亏的地方。
你可以把母版理解成 PPT 的底图。所有页面天生带着它的颜色、字体、页眉页脚和 Logo 位置。你在页面上看不到它,但它一直在。公司发给你的那个模板文件,值钱的部分就是这个。
AI 不懂这个。你要是只说"参考这个模板的风格",它会把母版当成一张普通图片,照着重画一遍。看着像,实际上母版已经没了——你交出去的文件,同事拿回去套自己的页面时全乱。
我做废过一次就是这么废的。
所以指定母版的时候,措辞必须硬。我现在固定这么写:
我有一个公司标准的 PPT 母版文件,你必须把它作为视觉权威。我需要在里面替换内容,但母版的背景、字体、Logo 一个像素都不许动。请走模板跟随流程,不要重建。
对比一下这句错误写法:
你参考这个母版的风格做一下。
"参考"和"跟随"是两个完全不同的指令。前者给了 AI 自由发挥的权限,后者没有。
这里要补一句实话。我用的那套开源 skill,官方版本其实不支持上传公司模板当母版——它们的仓库里,这个需求的 issue 现在还开着。我现在用的母版跟随流程,是我自己在它基础上扩出来的一层,配合那个命令行工具做母版和版式的保留。
所以如果你直接装官方版,别指望开箱就有这条路。要么等它支持,要么走第三条路自己搭,要么在导出后用命令行工具把母版补回去。
图 9|三个判断节点,三个出口。有公司模板就没得选,必须走中间那条
生成完不算完:出厂体检
PPT 导出来了,很多人到这一步就交付了。
我现在会再走一道。
导出之后,我用那个命令行工具做三件事:读一遍文件的结构统计,扫一遍已知的问题,跑一遍文件格式的合规校验。这三件事全是只读的,几秒钟就完。
如果发现要改字,我不在原文件上改,而是让它另存一个副本。原文件永远保留,这样改坏了随时能退回去。
这一步能捞回来什么?我实际捞到过的:某一页的图片槽是空的(生成的时候漏了)、标题字体和其他页不一致、以及一份文件里混进了两种不同的正文字号。这些用眼睛看很难发现,尤其是二十页以上的稿子。
但这里有个边界,我必须说清楚,这也是我认为全文最该记住的一句话:
能改文件,不等于能保真编辑。
命令行工具能打开文件、能改文字、能读结构,这是真的。但母版、动画、SmartArt、嵌入对象、以及那些你没动过的页面能不能原样保留,是另一件事,需要单独验证。
把"能改文件"直接当成"能保真编辑"来用,是这条路线上最容易出的事故。工具站在出口做体检,不代表它能替代前面的生产环节。
图 10|体检只读不写,要改字就另存副本。红字那句是整条流水线的边界
让 AI 自己看一眼它做的东西
还有最后一关:视觉检测。
渲染成功不等于好看,更不等于对。页面能打开,只证明它没崩。
我一开始是自己一页页看。二十页看下来眼睛就花了,而且越看越麻木,第十五页之后基本是在走过场。
现在我分成两半。
几何问题交给机器。元素有没有重叠、有没有出界、文字有没有溢出、字号够不够大,这些全是可以算的。业界现在的做法是读真实的字体宽度来算文字会不会撑破框,而不是靠估算——估算会漏掉那些"自动缩小字号"偷偷藏起来的溢出。
审美问题交给人。这一页想说的事说清楚了吗、视觉重心对不对、和上一页的气质连不连贯,这些机器判不了。
中间还有一层,是让多模态模型看图。把每一页导成图片、拼成总览图,让模型逐项核查变形、遮挡、出界、对比度、文字溢出,有问题的页面修完再复检一遍。这一层的价值在于它不会累,第十五页和第一页一样认真。
要提醒一句:别指望多模态模型判几何。它看"两个框有没有重叠"经常看错,这件事该由确定性的程序来做。让它做它擅长的——看气质、看有没有明显不对劲的地方。
图 11|能算的交给机器,说不清的留给人。中间那层让模型看图,价值在于它不会看到第十五页就累了
顺便说一条排版上的硬规矩,我从那套 skill 里学来的,现在写任何东西都在用:标题默认不加粗。
层级靠字号、颜色、位置和留白建立,不是靠加粗。一份 PPT 里到处是粗体,等于没有重点。同理,也别用缩小字号来塞更多内容——一页装不下就拆成两页,把字缩到十四号以下是在自欺欺人。
把整条流水线串起来
前面拆得很碎,这里合成一张图。
图 12|从平时吸收到交付回流。每一段下面标的是这一步的产物和卡点
四段,八步。
第一段是平时。吸收材料、拆解、归位。这段不占做 PPT 的时间,但决定了做 PPT 的时间。
第二段是启动。目标、受众、页数、交付格式,动手之前全部定死。这一步我会让 agent 生成一份清单落到文件里,后面所有环节都对着它做,避免做到一半跑偏。
第三段是生产。判路由、冻内容、画锚点稿、装配成可编辑对象。这段最花时间,也最出活。
第四段是收口。机器体检、视觉检测、交付、把这次的资产拆回素材库。最后这个动作最容易被跳过,但它是让下一次更快的唯一原因。
你的第一次:六步跑通
不要一上来就搭完整流水线。先跑通一次,哪怕内容随便。
第一步,装工具。把那套 PPT skill 和那个命令行工具装进你的本地 agent。装完先确认能调起来。
帮我安装 PPT skill 和 officecli,装完各跑一条最简单的命令,确认两个都能在本地调用。
第二步,冻参数。别急着让它做,先让它把这次的目标定下来。
我要做一个关于「季度复盘」的 PPT,受众是部门同事,目的是让他们看懂这季度我们卡在哪。大概十页,最后要能导出可编辑的 PPTX。你先帮我把这些参数冻结成一份清单,再动手。
第三步,画一页锚点稿。先只画封面或者第一页,跑通流程再铺开。
生成一张 4K(3840×2160)真 16:9 的演示文稿关键页视觉稿。版式:顶部 14% 放标题,中间放三个并列模块,底部放一行结论。配色用深蓝底加青色高亮,珊瑚红只用于风险项。 Text (verbatim, render each exactly once): "季度复盘" "做成了什么" "卡在哪里" "下季度怎么走" 禁止:Logo、商标、编造的数字、水印、多余文字。
第四步,装配成可编辑的。把锚点稿作为视觉基准交给 skill。
把这张锚点稿作为视觉基准,装配成可编辑的 PPTX。文字必须是真文本框,不许把整页当图片贴进去。
第五步,体检。
对这份 PPTX 跑一遍体检:结构统计、问题扫描、格式校验。有要改的地方另存副本,不要覆盖原文件。
第六步,自己看一眼。导成图片翻一遍。这一步别省,机器看不出气质。
跑完这六步,你手里会有一份能交出去、别人能接着改的 PPT。然后再回头看前面那些环节,会顺很多。
最后
这两个月最大的体会,不是 AI 让做 PPT 变快了。
是它把"返工"这件事的成本压下来了。
以前一页不满意,改的是版式、是字号、是配色,动一处牵一片。现在一页不满意,改的是那张锚点稿,改完重新装配一次,两分钟的事。
前面那些看起来很啰嗦的规矩——先画后制、逐字锁文案、只改文字不改构图、体检另存副本——省的都不是第一次的时间,是第二次、第三次的时间。
如果你只从这篇文章里拿走一件事,我希望是那个三秒自测:点一下标题,看光标能不能进去。
进不去的,那不是 PPT。