如何用智能体快速制作可交付PPT
- 2026-09-23 08:16:22
六月去长春参加 Light Conference 2026,做了一场20分钟的全英文口头报告,PPT一共30页。从零到定稿前后不到两天,整个过程自动化程度很高,我从头到尾只做三件事:给输入、定方向、做取舍。先搞清楚听众是谁,把三篇论文原稿丢给AI让它理出故事线,用PPT技能把样式定下来,让智能体规划好多少页、每页讲什么,再规划配图,最后用图像生成模型一页一页画。这篇把完整流程拆开讲。
先说背景:这是一个什么报告
报告主题是背景纹影层析(Background-Oriented Schlieren Tomography,简称BOST),一种用相机加随机点背景板测量流场密度分布的光学技术。报告所在的专场是 Track 6: Optical Imaging and Display Technologies。我是三篇相关论文的通讯作者,这场报告的叙事结构是我自己定的,我主动想把三篇工作串成一个完整故事来讲,跟会议方没关系,纯属我自己的设计。
三篇论文各自独立,如果按时间顺序一篇篇讲,听众听完记不住;如果硬凑,逻辑又容易断裂。这正好是AI擅长的事。
全程流水线:听众画像 → 论文×3 → AI理故事线 → 定样式 → 规划页数 → 规划配图 → image 2 生成,人只出现在两头:给输入、做取舍。
第一步:先搞清楚听众是谁
这一步我放在最前面,因为它决定了后面所有的设计。做PPT的目的不是把内容放上去,而是让听众听懂。听懂的前提,是先搞清楚他们是谁、懂什么、关心什么。
Light Conference 2026 这个报告,我的 section 是 Track 6: Optical Imaging and Display Technologies,光学成像与显示技术专场。这场听众的主体是做计算成像的研究者,对重建算法、神经表示这些很熟,但对流场测量本身并不熟悉。
这个画像直接影响取舍:BOST 的原理、流场诊断的背景,不能想当然,要从头讲清楚,因为听众不熟;而一旦进入重建环节,讲到神经隐式场、张量分解这些计算成像的核心,就可以放开了讲细节,因为这才是听众的主场。反过来也提醒我,讲流场应用时要多花力气让听众理解为什么这件事难、为什么值得做,他们关心的不是流场本身,而是你的方法能不能解决一类问题。
听众画像明确之后,我把它和报告主题、所在 Track 一起告诉AI。后面AI整理故事线、规划配图、生成页面,全程都在服务这批听众,而不是服务一个模糊的抽象观众。
听众画像决定三件事:讲多深(背景要不要科普)、讲多细(方法能展开到什么程度)、讲什么(听众关心的问题优先讲)。这三件事不搞清楚,PPT做得再漂亮也是自说自话。
第二步:只把三篇论文交给AI,让它理出故事线
这一步最容易被跳过,但恰恰是整个报告的骨架。我做的只有一件事:把三篇论文原稿交给AI,一份加工过的资料都没给,没有摘要整理,没有核心数据提炼,就是三篇论文本身。
要求也很明确,我告诉它:通读这三篇论文,理出它们之间层层递进的逻辑关系,整理成一条完整的故事线,每篇论文对应解决一个问题。
Better Quality → Faster Speed → Real Impact
AI理出来的主线是三个递进的词:NeRIF(神经隐式场)解决重建质量,4D张量分解解决速度,立体PIV补偿解决真实应用。三篇论文,三个问题,层层递进,顺着这条线讲下来,听众跟着走不迷路。
故事线定好,后面所有工作都在这条线上展开。这个顺序不能反,先有故事,再谈做PPT。
第三步:用PPT技能把样式定下来
故事线有了,接下来不是急着填内容,而是先把整套PPT的样式定下来。这一步我用的是PPT制作技能,当时装的是 PPT大王 这个skill,它的英文名就是 ppt master,同一个东西。它的工作方式很清晰,先确认需求,再套设计法则,最后输出一套完整的设计规格。
第一步是需求确认,把主题、受众、场合、风格偏好讲清楚。这场是学术会议,听众是计算成像研究者,场合是20分钟的英文口头报告,风格要学术、干净、信息密度高。
然后是设计法则。这个skill内置了一套完整的PPT设计黄金法则,包括版面布局、配色方案、字体规范和字号层级:
- 版面布局
三分法则、对齐原则(推荐左对齐)、亲密性(相关内容靠近)、重复原则(统一元素贯穿全文) - 配色方案
主色1到2种,辅助色2到3种,背景用白色或浅灰;内置了商务、科技、简约、学术四套预设配色 - 字体规范
标题、正文、数据分别用不同字体,字号有明确层级,主标题40到60pt,正文18到24pt,注释14到16pt - 动画克制
非必要不加动画,要用就用淡入淡出
最后输出设计规格说明,把配色方案、字体建议、排版布局一条条列清楚。我们这场最后定下来的样式是:白底、扁平设计、无阴影无渐变、全篇一套四色体系(紫、蓝、绿、青),每页顶部一条6像素的彩色装饰条,画幅比例16:9。样式一旦定死,后面30页全部照这个来,风格想乱都乱不了。
样式必须走在内容前面。先定样式,后面每一页的生成才有统一的参照系;样式不定,AI每页自由发挥,30页就是30个样子。
第四步:多少页、每页讲什么
样式定了,接着做逐页规划。这一步先规划页数和内容,完全不碰图片。
智能体把整场报告规划成30页,20分钟,平均每页40秒,然后一页一页过:这页讲什么、占多少秒、标题是什么、内容要点有几条。30页按故事线分成了几个板块,开场1页多,动机和背景5页,三篇论文各占一段(第一篇8页、第二篇7页、第三篇5页),总结和展望4页。
每页的内容要点也由智能体写好。比如标题页写清楚报告题目、作者、单位;动机页写清楚为什么需要光学诊断、折射率梯度怎么造成测量误差;每篇论文的页面写清楚核心方法、关键数据、创新点。内容规划是这轮的主业,图的事情一概不碰。我拿到规划稿,只需要过一遍,看板块分配合不合理、每页要点对不对,确认了就进入下一步。
页数规划先行,而且是智能体先行。总共多少页、每页讲什么、每页讲多久,全部由智能体定好,我负责审核确认。内容没想清楚,后面配图、生成都是空中楼阁。
第五步:再规划配图,哪些生成、哪些用原图
页数和内容定下来之后,才轮到配图。这一步同样交给智能体,让它把30页每一页的图源清单列出来,明确区分两类图。
- AI生成的图
示意图、信息图、概念图这类论文里没有的图,由AI负责产生,而且必须同时给出对应的绘图提示词,方便后面直接拿去生成。 - 论文原图
实验装置图、结果图这类必须保证真实性的图,直接从三篇论文里取用,AI只负责排版重绘,不改变数据内容。
这一份逐页规划做完,30页每一页的图源清单就齐了:哪页用什么图,新图怎么画,原图用哪张,全部写得明明白白。
配图规划放在页数规划之后。先想清楚内容,再决定图,顺序不能反。配图规划文件里每页都标注了:页面编号、标题、时长、内容要点、图源类型。缺的图单独标出来并附提示词,已有的图注明来自哪篇论文。
第六步:准备素材,交给ChatGPT用image 2一页页画
规划完成,我这边只做一件事:把素材准备好。论文原图导出来,AI生成图需要的提示词整理好,然后一并交给ChatGPT,让它用图像生成模型来产生PPT的每一页。
这里有一个重要的原则,PPT是一页一页生成的,不是一次全部生成。原因很实在:如果一次性把30页全生成出来,中途发现样式不对要修改,就得全部推翻重来,token消耗巨大,每次交互等待的时间也长,整个制作效率会被拖垮。所以做法是先精雕细琢地生成前面几页,把PPT的样式彻底定好,确认满意之后,后续页面全部照着前面的样式来,一页页顺着生成下去。这样即使后面要微调,也只是个别页面的事。
这里有个关键要求,页面的比例是16:9,但分辨率不能含糊,一定要让ChatGPT生成高清的PNG图片。会议报告投上大屏,图一放大,分辨率不够的页面立刻露馅。所以每页生成时都把分辨率要求写进提示词,保证输出的是高清大图,统一命名 Slide_NN_Title.png,方便后续拼装。
为什么用 image 2
因为 image 2 是目前世界上最好的图像生成模型。会议报告PPT是给几百人看的门面,审美不过关,内容再好也打折扣。要做就交给当前最强的模型。
还有一个容易忽略的细节,这些页面都是在网页版ChatGPT里生成的,不是用Codex命令行版本。当时是这么考虑的:网页版的任务量一般较少,从算力分配的角度看,同样的模型在网页版上的表现更稳,模型智商感觉也更高一些。既然要一页页生成最关键的页面,就用状态最好的那个环境。
生成时每页提示词写得非常细:背景色、标题字号、对齐方式、顶部色条高度、色值、图片位置和比例,全部写死。比如标题页,连顶部6像素的紫色条这种细节都写进去。AI按图索骥,30页风格高度统一。
另外,每次新建对话,先把一段背景上下文贴进去(大约350词,包含报告主题、听众画像、三篇论文的核心数据、配色体系和视觉规范),然后告诉AI Read and acknowledge。这是给AI的长期记忆,30页做下来风格不串味,全靠这一招。
最后提一个进阶玩法,我在 Codex 里装了一个叫 cowart 的 skill,它可以在PPT页面上放带箭头的注释,AI 能直接根据注释修改对应的PPT页面。等于你用手指在页面上画圈,AI就照着改。这个工具挺有意思,具体怎么用,下一期专门讲。
一个重要的选择:为什么不用代码直接做PPT
可能有朋友会问,PPT为什么不让AI直接用代码生成,比如用XML或者脚本语言拼出来?我的答案是:代码做不了好看的PPT。
道理很简单。图像生成模型是有审美的,它见过海量优秀的设计,知道一页PPT怎样布局好看、怎样配色协调、信息层级怎样排才舒服。而代码是语言,是个瞎子,它没有审美,不知道做出来的东西好看还是难看。
你当然可以给代码定一堆规范,字号多少、边距多少、颜色值多少,但规范是死的,并不适用于所有想做的PPT。这个报告是学术风格,那个报告是产品发布,换个场景规范就要重写,而且规范的边界永远追不上真实的设计需求。
所以最好的做法是:让图像生成模型去产生PPT的页面,它出的是有审美的成品;然后把这个成品转成可编辑的矢量文件,比如SVG文件,这样既能保留页面效果,又能在矢量层面自由修改文字、图形和布局。
如何把image 2生成的PPT页面转成可编辑的SVG文件,我会在另一篇文章里专门介绍,这篇先把生成这一步讲透。
AI生成的PPT,怎么把AI味去掉
用AI生成PPT,最难的不是让它生成,而是让它别带一股AI味。AI有个毛病,它喜欢往页面上堆东西:无关的小图标、装饰性线条、花哨的角落元素,看起来每页都很热闹,实际全是噪音,还特别像模板。
这一节分享我们总结的几条铁律,全写进提示词里,AI想发挥都发挥不了。
- 严禁与内容无关的图标。
这是最重要的一条,直接写进提示词:页面里出现的每一个图标、图形,都必须与当页内容直接相关,删掉任何一个都会损失信息。AI爱加的灯泡、齿轮、感叹号、抽象几何装饰,一律禁止。没有图标,也比放错图标强。 - 装饰必须有功能。
可以留下装饰性元素,但前提是它有实际作用。比如顶部色条用来区分章节,卡片边框用来分组信息,箭头用来表示递进。纯粹的装饰,宁可不要。 - 每页只讲一件事。
AI喜欢把多个观点塞进一页,结果每页都像菜单。规则是每页一个核心信息,辅助内容不超过三个要点,超过就拆页。 - 配色不许自由发挥。
AI一旦自由配色,就会变成五彩斑斓的糖果盒。全篇只能从第三步定好的色板里取色,主色、辅助色、强调色各司其职,超出色板算违规。 - 不做无意义的炫技。
3D立体、渐变阴影、透视变形,这些在学术报告里全是负分项。提示词里明确:扁平设计,无阴影无渐变,不做任何视觉炫技。 - 文字必须干净可读。
标题不超过两行,正文不用花哨字体,对齐方式统一。AI生成的文字如果出现错别字、英文大小写混乱、字体混搭,全部返工。
这些规则看起来苛刻,但恰恰是它们保住了PPT的学术感。AI生成的东西,人看着总觉得哪里不对,通常就是多了这些无意义的小元素。规则一收紧,AI味立刻淡下去。
检验AI味的一个土办法:把每一页所有图标和装饰都遮住,如果信息依然完整,说明这些元素就是多余的,删掉。如果信息受损,说明它们有功能,留下。
配色体系:一页就能看出是哪个工作
30页的PPT如果每页一个样,翻起来很累。第三步定样式时,我们给三篇论文各配了一个主题色,全篇只用这一套颜色:
听众即使没听懂内容,翻到紫色区块就知道讲的是第一篇,颜色成了导航。这个细节投入产出比极高。
PPT之外:讲稿、配音、发布文案一次配齐
光有PPT还不够。做报告的人都知道,讲稿往往比PPT更费时间。这次我把讲稿也交给同一套流程:
配套产出清单
英文讲稿:逐页配好说话内容,每页标注时间,含转场提示,照着念就是完整20分钟。
AI配音:用免费语音合成工具把讲稿转成音频,逐页配音,还能拼成视频,详见下一节。
发布文案:报告结束后把内容改造成B站视频文案,一份素材多平台复用。
这些产出一脉相承,因为故事线和配图规划是同一套,改起来不费力。
展开讲讲:配音和视频是怎么做出来的
很多人对配音这步感兴趣,这里详细拆开讲。配音和转视频全程都是在 WorkBuddy 里用 DeepSeek V4 模型驱动的智能体完成的,我只需要发指令,具体装什么软件、怎么装,全部是智能体自己下载安装。当时 WorkBuddy 送了免费积分,跑完整个流程非常便宜,根本不花钱。
文字转音频:Edge-TTS,智能体自己装好的
文字转音频用的是微软的 Edge-TTS,就是 Edge 浏览器背后那套文本转语音服务。它通过一个开源的 Python 库 edge-tts 调用。这个工具完全免费,不需要注册账号,不需要 API key。关键是整个安装过程我都没碰,是智能体检测到需要这个库,自己用 pip 下载装好的,装的版本是 7.2.8。
选的声音是云扬,微软的中文男声,英文朗读也自然流畅,很适合学术报告这种场合。当时做的是全英文配音,我自己一句话都没录,全部交给它念。
做法是把讲稿按页拆开:每一页的讲话内容单独拎出来,一页一段文字,逐页转成 MP3。最后生成的就是 slide_01.mp3 一直到 slide_30.mp3,30 页对应 30 个音频文件,文件名和页面编号一一对应,后面拼装不会乱。
音频加到 PPT 里转视频:ffmpeg,也是智能体装的
音频有了,接下来是把音频和 PPT 页面合成视频。这里用的是 ffmpeg,一个免费开源的音视频处理工具。它也不是我手动装的,是智能体发现需要转视频,自己通过 WinGet 下载安装的,装的是 Gyan 构建的 8.1.1 版本。
具体做法是把每一页的 PNG 图片和对应的 MP3 音频按顺序拼接:一页画面配一段声音,时间轴对齐,ffmpeg 一条命令就能输出完整的视频文件。这样生成的视频,配音、画面、节奏全部对齐,可以直接用来发布。
整个配音加视频链路:讲稿按页拆开 → Edge-TTS 云扬逐页转 MP3 → ffmpeg 把 PNG 页面和 MP3 合成视频。全部由 WorkBuddy 智能体在 DeepSeek V4 驱动下完成,软件自动安装,免费积分跑完全程,从文字到成片不用手动录一句话。
这套零成本链路后来成了我做视频的固定配置。很多收费的配音软件,效果未必比它好,而它用送的积分就能跑,几乎等于不要钱。
几点心得
- 听众画像永远最先做。
做PPT的目的是让听众听懂,不是展示自己。先搞清楚他们是谁,后面每一步才有的放矢。 - 只给输入,不做加工。
三篇论文原稿直接交给AI,故事线、页数规划、配图清单全是智能体理的,人不用提前做任何整理。 - 自动化程度越高,人力越省。
从理故事线到规划页数到列配图清单到配音转视频,每一环智能体都能接管,人只出现在两头:给输入和做取舍。 - 样式先定,全篇统一。
用PPT技能把配色、字体、版式定死,30页才不会跑偏。 - 先规划页数内容,再规划图。
内容没想清楚之前不碰配图,顺序不能反。 - 用当前最强的图像模型。
做PPT的门面,值得用最好的工具。 - 细节写进提示词。
字号、色值、边框、对齐,写死了AI才不发挥。自由发挥是设计事故的源头。 - 人只做取舍。
生成稿来回迭代了四个版本,每一版我都只做减法:删多余的、改不准的、统一不齐的。
这套流程后来被我反复用在其他报告和演讲上,套路一样:听众画像先行、只给论文原稿、智能体理故事线、样式定死、页数内容智能体规划、配图规划前置、图像模型生成、人只做取舍。工具在变,方法不变。
本文由龙虾科研原创