PPT做完还能继续用:用AI Skill读懂内容、写分镜,再生成讲解视频
- 2026-09-22 10:32:05

上一篇,我把已经发布过的 52 篇公众号文章交给 AI,最后整理成了一份 14 页的《鲨域 AI 海图》。它不只排列文章标题,而是重新找出了内容主线、关键词关系和不同读者的阅读路线,还为每一页写了对应的演讲稿。
页面、结构和逐页讲稿都有了,这批内容其实还可以继续往后走:让 AI 理解每一页要表达什么,再完成分镜、配音、字幕、动效和视频合成。
这次我使用的是 product-video Skill。最终得到的是一段 6 分 31 秒、1920×1080 的 PPT 讲解视频。它按照原始 PPT 的 14 页顺序播放,使用晓晓女声配音,带同步字幕、淡入淡出和轻微推拉效果。
从一份 PPT 开始,AI 要先补齐“怎样讲”
把 PPT 做成讲解视频,真正需要补上的并不是一个视频文件,而是“怎样讲”:每一页承担什么作用、页面之间怎样过渡、哪些信息应该由画面呈现、哪些内容需要旁白补充,以及不同页面应该停留多久。
《鲨域 AI 海图》的第二页展示 52 篇文章怎样分布在六片海域,第三页才开始解释它们背后的共同主线。如果所有页面固定停留相同时长,讲解很容易和画面错开;如果只朗读页面文字,又会把一份演示稿讲成说明书。
这次 PPT 已经有逐页备注,AI 可以先读取页面和演讲稿,检查两者是否对应,再把讲稿整理成适合配音的连续口播。页面负责让人看见结构,讲稿负责把结构讲明白,两者一起成为视频输入。
如果 PPT 没有演讲稿,AI 也可以根据标题、正文、图表和前后关系先起草。正式制作前,product-video Skill 会先整理出时间线、画面描述、素材需求和配音文字,让人确认讲述方向和页面节奏。
这一步的作用,是在配音和渲染之前尽早发现偏差。页面上写的是“能力群岛”,作者真正想讲的可能是“不要看到插件就全部安装,而要先判断任务缺什么”。AI 能补齐表达,却不能凭空知道作者没有写出来的立场。先确认分镜,修改的还是几段文字;等视频全部生成以后再发现方向不对,配音、字幕和画面都要重新制作。
因此,完整顺序是:
读取 PPT 和备注
↓
理解整体主线与逐页作用
↓
整理或起草逐页讲稿
↓
设计页面时长、画面与配音分镜
↓
人工确认讲稿和分镜
↓
生成配音、字幕、动效和成片
Skill 把这些步骤串成了一条制作流程
理解页面、改写讲稿、判断前后关系,依赖的是 AI 的通用能力。product-video Skill 并没有凭空为模型增加一种“视频天赋”,它做的是规定先后顺序、调用相关工具,并把交付和检查项目固定下来。
它先判断视频属于哪种类型:展示软件操作的录屏演示型、以图片和文字为主的图文展示型,或者把两者结合起来的混合型。《鲨域 AI 海图》已经有完整 PPT,因此走的是图文展示路线。

分镜确认后,后面的工作才依次展开:逐页准备画面,根据讲稿生成语音,用实际配音时长决定每页停留多久,再切分同步字幕、加入动效、合成视频。最后还要检查配音是否重叠、空白是否过长、字幕是否异常,以及成片能否完整播放。
在这条流程里,人负责定义目标、选择声音、确认分镜和验收结果;AI 负责理解材料、整理讲稿、生成内容并调用工具;Skill 则负责把步骤和规则组织起来。
会用 AI 的关键,是把模糊需求变成可执行、可检查、可复用的流程。
第一版出来后,真正的验收才开始
第一版视频很快就生成了,但“有一个 MP4 文件”和“这个视频可以交付”并不是一回事。
最明显的问题出现在字幕里:每段末尾多出了一个反斜杠。它不影响播放,却会反复提醒观众这是一段没有经过检查的机器产物。
声音也需要继续调整。晓晓的音色适合这份 PPT,但第一版分句太碎,句子之间像被切成了一块块音频,听起来清楚,却缺少连续讲述的感觉。后续改为每页先生成一段连续配音,再根据语音边界切字幕,节奏才更接近完整演讲。
另一个问题来自画面。视频需要一点运动,否则六分多钟的静态页面会显得过于平;但推拉幅度稍大,页面边缘就可能被裁掉,字幕底板位置不合适,也会让原本完整的 PPT 看起来像少了内容。
最终版本没有重排 PPT,而是从当前文件按原顺序逐页导出,保留完整页面,只在外圈安全边距内加入约 1% 的轻微推拉。字幕固定在画面上,不跟着页面一起移动。完成后再从视频中逐页抽帧,核对 1—14 页的顺序和四边内容。
下面这张图来自最终成片的抽帧验收。最后一页连续出现,是因为片尾保留了停留时间;检查重点是页面顺序、字幕位置和四边是否完整。

几轮修改最后变成了一组更明确的验收规则:
一次修改解决的是当前视频;把问题变成检查规则,才能减少下一次重复踩坑。
不只有 PPT 可以成为视频的起点
PPT 讲解只是 product-video Skill 的一种用法。它支持图文展示、软件录屏和混合视频,因此已有材料也可以换成产品网页、屏幕录像、文章、报告或产品截图。
这里有一个边界:Word、PDF 和文章并不是直接“另存为视频”。AI 仍然需要先理解材料,决定哪些内容由画面承担、哪些由旁白解释,再进入分镜、配音和合成。
对于内容相对稳定、又需要反复讲解的场景,这种方式尤其有用。新员工可以先看统一的入职培训,客户可以先了解产品基础功能,团队成员可以先掌握方案背景,后续沟通再集中处理问题和具体情况。
偶尔使用复制任务,高频使用再固化规则
如果只是偶尔把一份 PPT 制作成讲解视频,不必先定制新的 Skill。可以把材料和下面这段任务说明交给 AI:
请调用 `product-video` Skill,把我提供的 PPT 制作成一段带配音和字幕的讲解视频,并按照该 Skill 的流程先完成需求分析和分镜确认。
要求:
1. 严格按照 PPT 原始页码和内容顺序制作,不改写或遗漏页面文字;
2. 优先读取每页备注中的演讲稿;
3. 如果没有演讲稿,请根据页面内容起草逐页讲稿,并先交给我确认;
4. 正式制作前,先输出分镜,包括页面、时长、画面动作和配音文字;
5. 根据内容风格推荐合适的中文声音,提供试听后再确定;
6. 生成与配音同步的字幕,字幕尽量单行显示;
7. 可以添加轻微推拉和淡入淡出,但不能裁切、遮挡或重排 PPT 内容;
8. 输出 1920×1080、30fps 的 MP4;
9. 交付前检查字幕异常字符、页面顺序、文字完整性、音画同步和视频解码。
在我确认分镜和配音声音之前,不要开始最终渲染。
如果这类视频每周都要制作,反复复制要求就不再是最好的办法。此时可以在现有 product-video Skill 基础上,建立更适合自己的规则:固定声音、语速、字幕位置、页面动效、品牌元素、输出目录和验收清单。
本次遇到的字幕异常、配音割裂和页面裁切风险,也可以直接写进规则。下一次再提供新的 PPT,AI 就不需要等问题出现以后才知道应该注意什么。
定制 Skill 不涉及重新训练模型,也不意味着把全部工作交给 Skill。它的价值,是把已经验证过的方法、偏好和纠错经验固定下来。
安装 product-video Skill
这次使用的 product-video 来自开源项目 MatrixReligio/ProductVideoCreator。仓库中除了主 Skill,还包含分镜、录屏、配音、背景音乐、字幕、视频合成和素材收集等相关 Skills。
可以使用下面的命令安装主 Skill:
npx skills add https://github.com/MatrixReligio/ProductVideoCreator --skill product-video
安装前建议先打开仓库阅读 SKILL.md,确认来源和具体行为。网络上可能有同名 Skill,直接指定 GitHub 仓库地址,比只按照名称搜索更不容易装错。
Skill 本身是一套工作流程,不会自动提供全部运行环境。原仓库列出的依赖包括 Node.js、Python、FFmpeg 和 Git;默认技术方案使用 Remotion 合成视频、Playwright 录制网页操作、edge-tts 生成配音,FFmpeg 负责音频处理等任务。
本次 PPT 视频没有浏览器录屏,也没有使用 Remotion 搭建 React 视频项目。我沿用了 Skill 的分镜、配音、字幕和验收流程,实际使用 edge-tts 生成配音,再用 FFmpeg 完成页面动效、字幕叠加、音视频合成与最终封装。
原仓库主要面向 macOS、Linux,Windows 推荐使用 WSL;不同 Agent 和本地环境的安装方式可能略有区别。
PPT 做完以后,内容仍然可以继续流动
回头看这两次制作,同一批内容经历了一条完整路径:52 篇公众号文章先被重新理解和分类,变成《鲨域 AI 海图》PPT;页面和演讲稿又继续成为分镜、配音、字幕与讲解视频的输入。
公众号文章
↓
内容主线与知识地图
↓
可编辑 PPT + 逐页演讲稿
↓
分镜 + 配音 + 字幕 + 动效
↓
完整讲解视频
文章、PPT、演讲稿、录屏和视频之间原本断开的环节,现在可以被同一套工作流连接起来。同一份内容不必在每个渠道重新从零开始。它可以先被整理成结构,再根据使用场景变成演示稿、讲解视频、培训材料或产品介绍。
AI 提供理解和生成能力,Skill 组织流程,人负责目标、判断和最终验收。真正能够积累下来的,是让已有材料继续产生价值的方法,以及把一次成功逐渐变成可重复能力的规则。
如果你也在尝试让 AI 接手一段真实工作,欢迎在留言里说说你的场景:你正在把哪些材料变成新的交付物,想打通哪几个原本分开的环节,又遇到了什么问题?PPT、文章和视频之外,也许还有更多值得被连接起来的工作。
主要资料
ProductVideoCreator:https://github.com/MatrixReligio/ProductVideoCreator