阿里Wan3.0:扔个PPT就出30秒视频
- 2026-09-23 05:34:10
做短视频这两年,我最烦的一件事是:拍和剪比写脚本还累。脚本十分钟想完,架机位、打光、录好几遍、再剪半天,一天就这么没了。
昨天阿里把视频大模型 Wan3.0 正式放出来了,它能直接"吃"你的 PPT、Word、PDF 这些文档,一次吐出最多 30 秒的视频成片。这篇就聊聊,这玩意到底能不能让普通人不用相机、不用剪辑软件,就把视频做出来。
说白了,它就是个"全自动视频工厂"

先解释一下"视频大模型"是啥。大模型你大致听过,就是那种能聊天、写字的 AI;"视频大模型"是它的一个分支,专门干一件事:把文字、图片变成"会动的视频"。你把它当成一个从没见过真人、但看过几亿条视频的剪辑师傅就行。
Wan3.0 是阿里通义那边做的视频大模型。它这次最让我意外的一点:以前这类工具基本只认"一段话描述",你得像写剧本一样告诉它要什么画面;Wan3.0 第一次能直接读 doc、xls、ppt、pdf、md 这些办公文档。换句话说,你平时写的工作汇报、课件、方案,不用重新改写成剧本,直接拖进去它就能试着变成视频。
它还顺手把角色长相、道具、声音、运镜(就是推拉摇移跟这些拍片手法)在一整段视频里保持一致,最多吃 20 份参考素材。这正好治了之前 AI 视频一个老毛病,上一秒主角穿红衣,下一秒变蓝了。
跟你具体有啥关系
别觉得这是大厂炫技,落到普通人身上很具体:
做自媒体的:你有一份产品介绍 PPT,以前得背稿拍、再剪;现在丢进去,先出个 30 秒粗剪版,你再补真人出镜的部分。 职场人:周报、方案想汇报得生动点,把文档转成视频,开会投屏比念 PPT 有人看。 老师、培训岗:课件一键变讲解视频,学生能反复看。 小商家:几张商品图加一段文案,能凑出一条带货短片,省下请拍摄团队的钱。
钱包层面也得说清楚。它的 API 按秒计费:480P 每秒 3 毛、1080P 每秒 1 块 2,现在到 9 月 23 日打 7 折。算笔账——一条 30 秒的 1080P 视频,折后大概 25 块。跟请个拍摄团队动辄几千比,这价格对个体户太友好了。
现在能怎么上手
我按官方给的入口试了一遍,普通用户这么走就行:
打开万相官网(wanxiang.aliyun.com)或千问创作(c.qianwen.com),注册登录,能领新人免费生成额度; 把你的 PPT 或 PDF 传上去(注意控制在 50 页内、100MB 以下,超了会解析失败),配一句提示词,比如"30 秒产品宣传片,统一模特形象"; 选 480/720/1080 分辨率,点生成,等几十秒出片,不够长还能续写二次编辑。
开发者想接自己系统,去阿里云百炼开个 API Key,模型 ID 填 wan3.0-video 就行,用量明细在后台看得清清楚楚。
但是
我落地时注意到几个实打实的边界:一次最多 30 秒,拍不了长剧情;复杂运镜和多人物对话还容易翻车;角色一致性比上个月强,但还没到"你完全不用管"的地步。文档超过 50 页、参考图一次堆太多,画面也会飘。
所以"AI 会不会抢饭碗"这个问题,我倾向于这么看:做模板化口播、种草、简单宣传片的人,单子价格会被压,因为客户发现 25 块能出个七十分的片子,就不一定花两千找人了。但真人出镜、带情绪和临场反应的视频,短时间替代不了。
给你个判断标准:如果你的视频核心价值是"信息讲清楚",那交给 Wan3.0 省时间;如果你的价值是"这个人说话有意思、有信任感",那就别省真人那部分。工具把门槛削平了,反而"你脑子里有没有货"变得更值钱。
你现在能试的:打开万相官网,把你积灰的一份 PPT 丢进去,看它给你变出啥。
觉得有用点个在看,转给正在纠结要不要做视频的同事。
请在微信客户端打开