
最近三个月,我一直用 HTML PPT 做线下演讲。
AI 做 PPT,最隐蔽的坑不是丑。
丑反而好救。换套模板,调一下字体,换个配色,至少还有明显抓手。
真正难救的是:页面看着不差,甚至挺高级,但你站上去讲的时候,突然发现自己没话说。
这一页只有三个词和一张大图,观众看着像海报,我看着像谜语。
下一页塞满了密密麻麻的小字,我一开口就变成念稿。
再下一页标题写着“技术架构”,下面还有个没填完的 TODO,占位符明晃晃地躺在那里。
这种尴尬我碰过太多次。


所以我后来做 PPT,不再只问一个问题:
“能不能做得更漂亮?”
“这页真的能被拿去讲吗?”
这就是我做 Humanize PPT 的原因。
它不是又一个负责把页面做炫的模板工具。
我更想让它解决 PPT 上游的问题:资料怎么编排,每页承担什么任务,观众听到这里应该发生什么变化,素材放在哪里,讲稿怎么跟着页面走,最后交付前怎么检查它是不是真的能投出去。
我一开始也走过弯路。
做 HTML PPT 的时候,我试过很多办法。
按章节换颜色,做左右分栏,上下分栏,三列式,四宫格。能调的版式基本都调过。
但到某个阶段你会发现,问题不在模板数量。
同样一堆材料,换十套模板,最后还是那种味道。
像把马铃薯炒成土豆。
真正的问题在上游。
AI 在生成 PPT 前,并没有真正想清楚:
这一页为什么存在?
它要推进一个判断,解释一个阻力,还是让观众突然意识到“原来这件事还能这么看”?
观众看到这一页之前是什么状态?看完以后应该带走什么?
如果这些问题没想清楚,下游渲染器再努力,也只是把一个松散大纲包装得更好看。

所以 Humanize PPT 从一开始就不想抢下游渲染器的活。
它负责把大纲、逐页意图、图片和视频素材坑位、演讲稿,整理成结构化的 JSON 和 Markdown。
然后再交给真正擅长视觉渲染的下游 Skill。
中文可以接 guizang-ppt-skill。
英文可以接 frontend-slides、beautiful-html-templates。

这样做的好处是,渲染器不需要被替换。
变的是上游。
同一套视觉体系,前面如果只是“背景、痛点、方案”式的资料整理,做出来就像一个漂亮文件夹。
但如果上游先把观众状态和页面任务想清楚,页面就会开始往演讲推进。

Humanize PPT 里最重要的框架,是 AST。
A 是 Audience。
观众是谁?他们已经知道什么?他们为什么愿意继续听?他们真正关心的是概念、结果、风险,还是下一步怎么做?
S 是 State。
观众进入这一页之前是什么状态?困惑、怀疑、无感、兴奋,还是已经快要跟丢了?
看完这一页以后,他们应该变成什么状态?
T 是 Transfer。
这一页怎么把观众从前一个状态,推到下一个状态?
这三个问题看起来不复杂,但它会逼着每一页 PPT 从“展示信息”变成“推进状态”。

以前我做大纲,很容易写成:
背景。
痛点。
方案。
优势。
案例。
总结。
这套结构不是不能用,但它很容易变成资料归档。
Humanize PPT 会换一种方式处理:
这一页观众进来时,以为 AI PPT 的问题是模板不够多;离开时,他应该意识到,真正的问题是页面没有演讲任务。
下一页观众进来时,可能觉得“那换个更强的 PPT Skill 不就好了”;离开时,他应该理解,上游编排和下游渲染是两件事。
再下一页观众进来时,知道 AST 这个概念;离开时,他应该能用 AST 判断自己手上的一页 PPT 能不能讲。
页面标题也会跟着变。
它不再只是“背景介绍”“问题分析”,而会变成更像演讲现场能说出口的话。

这个变化很小,但很关键。
渲染器没有换,页面气质会变。
因为它不再是把信息铺开,而是在带着观众往前走。
AI 做 PPT 还有一个很烦的问题:一口气生成二三十页,看起来很爽,返工的时候也很爽。
爽到想关电脑。
因为等整份 deck 出来以后,你才发现字体不是你想要的,信息密度不对,动效太花,图片风格不统一,或者每一页都像海报。
这时候再改,成本已经很高。
所以 Humanize PPT 里我加了一个很实用的机制:先渲染四张真实页面。

不是看色板。
不是看几句抽象的风格描述。
也不是让 AI 说“我将采用高级、克制、现代的视觉语言”。
这种话太便宜了。
我想看真实页面。
标题怎么压,正文怎么排,图放在哪里,留白够不够,信息密度是不是能讲,投到屏幕上会不会太散。
先拿同一份内容渲染四张出来,看完再决定要不要继续。
方向对了,再沿着这套视觉体系把剩下的二三十页做完。
方向不对,就在四页阶段掉头。
这一步救过我很多次。
因为 PPT 最怕的不是慢,而是快到最后才发现一开始就错了。
以前我让 AI 出大纲,它经常会写一句:
“这一页可以放一张相关图片。”
这句话基本等于没说。
相关是什么?放哪里?图要承担什么功能?是解释概念,制造情绪,还是作为转场?文件叫什么?用什么 prompt 生成?如果是视频,用什么形式做?
这些不提前设计,后面就只能硬塞。
所以在 v0.9 里,我把素材坑位也放进了大纲。

每一页如果需要图片或视频,就提前写清楚:
它应该放在哪。
它承担什么表达任务。
文件名是什么。
需要用什么 prompt 去生成。
如果是流程型内容,先做 SVG 流程图,再转成 Remotion 视频,很多时候比直接硬生视频更稳。


这一步看起来像细节,其实是 PPT 能不能讲的重要分水岭。
素材不是装饰。
素材应该承担页面任务。
一张图如果只是让页面不空,那它很可能是噪音。
一个视频如果只是为了显得高级,但没有推动观众理解,那它也只是负担。
很多 AI PPT 最大的问题是:页面归页面,讲稿归讲稿。
做完以后你还要自己对稿,自己标注这一页讲什么,下一页怎么接。
这件事非常消耗人。
Humanize PPT 里我希望它从生成阶段就把演讲稿分配到每一页。

输出的 deck 支持演讲模式。
按 S 键,可以打开一个独立的演讲稿窗口。
里面有页码,也有备注。
如果你有第二块屏幕,就能一边看观众,一边让备注跟着页面走。
不用背稿,也不用在一堆文档里来回翻。
按 ESC,还可以打开全局索引。
所有页面缩成一张总览。
讲到一半如果想临时跳页,不用一页一页往回翻,点一下就过去。


这才是我想要的“为演讲准备”。
不是只把页面做出来,而是把我站上去以后怎么讲,也一起接住。
HTML PPT 还有一类问题特别烦:代码没错,页面也能打开,但投出来就是不对。
我见过静态扫描全绿的 deck。
0 fail,0 warn。
结果截图逐页看,左下角页码把正文最后一行吃掉了一半。
观众实际看到的是半截句子。
这种问题,在代码层面不一定报错,但在演讲现场就是事故。


所以我后来把质检单独拎出来。
不只检查 HTML 结构。
还要看真实截图,看有没有遮挡、截断、重叠、TODO、缺图、字号过小、页面主体不清楚。
能修的,就在不破坏视觉体系的前提下修掉。


我现在对 AI 交付物越来越有一个判断:
只生成,不质检,不能算完整工作流。
尤其是 PPT 这种要上屏幕、要面对观众的东西。
它不是在本地文件夹里好看就行。
它要经得住投影、翻页、讲述、临场跳转。

我之前很长一段时间都在纠结:怎么让 AI PPT 更漂亮。
后来发现,漂亮当然重要,但它不是终点。
演讲里的 PPT,真正决定有没有用的,是你翻到下一页时,观众有没有跟着你一起往前走。
如果一页 PPT 在观众短暂分神后,回神就看不出主体,那它失败。
如果一页 PPT 只能逼着你照着念,那它也失败。
如果一份 PPT 做出来需要你再花大量时间对稿、找图、修遮挡、补 TODO,那它就还不是一个完整的 AI 工作流。
Humanize PPT 想解决的,就是这些很具体、很烦、但真实存在的问题。
它把 PPT 从“看起来很高级”,往“真的能拿去讲”推一点。
页面要好看。
但更要能讲。
素材要高级。
但更要有任务。
讲稿要存在。
但更要跟页面同步。
代码要通过。
但更要投出来不翻车。
这就是我做这套 PPT Skill 的原因。
我不想再拿着一份看起来不错的 AI PPT,站到台上以后跟观众大眼瞪小眼。
我想要的是:翻到下一页,我知道要讲什么,观众也知道为什么要继续听。
知识星球「器用之间」会持续更新 AI 工具、自动化流程、项目复盘、案例资料和可落地的实操干货。感兴趣可以直接看下方图片,长按二维码加入。
长按识别二维码加入,一起看 AI 工具、案例、流程和小项目。
AI TOOLS · WORKFLOWS · BUSINESS NOTES