下周一要给新同事讲一遍产品更新。
PPT 已经改到第五版,讲解人却临时出差。你可以继续约时间、开会、录屏、重录;也可以把每一页变成一个视频场景,让 AI 头像照着脚本讲。
Google Vids 现在已经把这条路打通了:Slides 可以直接变成视频场景,AI 头像负责讲解;新上线的个人分身还能复刻账号本人的脸和声音。
但先把最容易踩的坑说清楚。
“预设 AI 头像”和“个人分身”不是一回事。预设头像能说中文;像你、声音也像你的个人分身,首发阶段只支持英语。直接把两者混在一起,做中文视频时一定会卡住。
先别录脸:把 5 页 PPT 拆成 5 个场景
假设要做的是一份“产品功能更新”讲解。不要让 AI 对着整份 PPT 自由发挥,先把每一页的任务写死:
场景 1|15 秒:一句话说明这次更新解决什么问题。
场景 2|30 秒:只讲 3 个核心变化,不逐字念页面。
场景 3|35 秒:用“以前怎么做、现在怎么做”讲清操作流程。
场景 4|30 秒:列出 2 个最容易犯的错误。
场景 5|20 秒:告诉观众下一步去哪里、完成什么动作。
这样整条视频大约 2 分钟,每一段都远低于单个 AI 头像片段 60 秒的上限。后面哪一页改了,只重做对应场景,不必整段推倒重录。
Google 官方展示的 Slides 转 Vids 流程:每页变成一个场景,脚本、头像、旁白和动画都能在生成草稿前调整。第一条路线:中文 PPT,现在就用预设 AI 头像
如果原文件是 PowerPoint,先上传到 Google Drive,用 Google Slides 打开。Vids 官方直接接收的是 Google Slides 演示文稿。
1. 在 Slides 中打开演示文稿:确认字体、图片和动画没有错位。
2. 进入 Vids 的 Convert Slides:选择要导入的页面,每一页会变成一个视频场景。
3. 中文稿不要依赖一键自动生成:先只导入场景,再逐页补自己的中文讲稿。
4. 打开 AI Avatar:选择预设头像,粘贴对应场景的中文脚本,预览后插入。
5. 最后统一节奏:让场景时长跟随讲解,检查字幕、停顿、页面切换和结尾动作。
预设 AI 头像自带外形和声音,适合先把中文培训、产品更新和操作说明做起来。场景 2 的中文讲稿可以直接照下面这个结构写:
这次更新只需要记住三件事。 第一,入口从首页右上角移到了工作台; 第二,提交后会先生成预览,不会立刻对外发送; 第三,历史版本可以随时恢复。 接下来我用一页图,带你看完整操作。
这段稿子没有复述页面上的每个字,而是先给结论,再把观众带到下一步。AI 头像只是讲解人,真正决定视频能不能看下去的,还是脚本有没有取舍。
Google 官方语言列表包含 Chinese;这里指的是预设 AI 头像的脚本朗读,不是个人分身。第二条路线:英语视频,再录自己的脸和声音
个人分身更像一个“可重复调用的本人素材”。第一次创建时,电脑端会给出二维码;用手机或平板完成真人脸部与声音采集,之后这个分身会跟 Google 账号关联。
Google 官方示例里,个人分身被用作网页课程讲解人;它的价值不是一次成片,而是后续可以换脚本、换场景继续生成。
个人分身要求符合条件的套餐、年满 18 岁、拥有 Google 账号和手机或平板;首发只支持英语,并有地区限制。录制这一步看似简单,实际比写提示词更严格。手机要与眼睛平齐,光线不能太暗或过曝,眼睛、鼻子和嘴必须清楚;背景里不能出现其他人脸,环境里也不能有其他说话声。
采集必须由账号本人完成;Google 明确要求背景没有其他人或人脸图像,也不要让未成年人参与录制。个人分身生成时,提示词要管画面,脚本要管嘴里说什么
例如把第三页“新操作流程”做成一个横屏场景,可以这样写:
Create a 16:9 internal product update scene. Use my personal avatar as the presenter. Place the presenter on the right side of the frame, leaving space for a simple three-step interface diagram on the left. Use calm gestures, clear eye contact and a professional office background. Script: “The new workflow has three steps. First, open the workspace. Second, review the generated preview. Third, confirm before anything is sent. The final confirmation remains with you.”
画面要求和口播内容分开写,后面改版时会轻松很多:界面变了,改画面和对应一句话;流程没变,其余场景不用重做。
别把一段讲稿塞满 60 秒
官方帮助页写明,单个 AI 头像视频最长 60 秒,而且不同套餐的月度生成次数不同。真正实用的做法不是把每段顶到上限,而是把一个观点控制在 20~40 秒。
单个 AI 头像视频最长 60 秒;生成次数按套餐计算,不能把它当成无限量渲染工具。一个场景只讲一个结论。需要解释第二件事,就切到下一页。
每段先写 80~120 个中文字。预览后再根据语速增减,不要一次塞满。
数字、产品名和缩写单独试听。读错就改成更容易念的写法。
每次只重做一段。先确认脚本,再生成头像,减少浪费生成次数。
这三类内容适合,另外三类先别交给分身
适合:产品更新、员工入门、标准操作、课程预告、固定口径的功能演示。
原因:脚本稳定、镜头可拆、哪一段变了就替换哪一段。
不适合:道歉声明、重大人事消息、高情绪品牌故事、需要现场信任的销售承诺。
这些内容的价值来自真人当下的表情、承担和互动。技术上能生成,不等于沟通上应该生成。
开始前,按这张清单判断走哪条路
要中文:先用预设 AI 头像,逐场粘贴中文脚本。
要自己的脸和声音:确认英语、地区、年龄和套餐条件,再创建个人分身。
原文件是 PPT:先用 Google Slides 打开,检查排版,再转成 Vids 场景。
内容会频繁更新:一页一个场景,一段一个结论,方便单独替换。
内容涉及承诺或信任:保留真人出镜,不要把“能做”误当成“该做”。