PPT直接变视频,阿里Wan3.0把做视频的门槛砍到脚脖子
- 2026-09-24 02:32:21
PPT直接变视频,阿里Wan3.0把做视频的门槛砍到脚脖子
8月24日,阿里巴巴视频生成大模型Wan3.0正式上线千问平台。这篇的信息来自阿里技术官方发布稿、潮新闻、新浪科技等几篇报道,加上产品经理社区的一篇深度评测。模型我还没有亲自跑过,只做转述和判断。但看完这些材料,我对「普通人离做视频有多远」这件事的看法,被实实在在挪动了一格。
一个女孩的白纱和眼球,暴露了AI视频的进化速度
先讲一个我在报道里反复看到的画面。
一段人物视频里,女孩的眼球反射、毛发细节、白纱运动、水面光泽,四种最难还原的物理属性出现在同一个镜头里,而且全程守住冷灰蓝调,皮肤没有塑料感。这个细节来自企业用户Flova AI的评测反馈,不是我实测的,我如实标注。
我为什么盯着这个细节看。因为AI视频过去最要命的破绽,从来不是画面糊,是「一眼假」。人物皮肤油腻得像充气玩偶,换个镜头脸就变了,观众不需要懂技术,扫一眼就知道不对劲。而这四个物理属性,反射、毛发、布料、水面,恰好都是「实拍才有的物理感」,机器造不出来就露馅的地方。
Wan3.0这次把它们摁在同一个镜头里,说明模型的努力方向变了,从追求单帧好看,转向追求物理世界的可信。这是一个比「能生成视频」更重要的信号。
单次30秒,AI视频第一次够讲完一个故事
第二个硬升级是时长。Wan3.0单次最长生成30秒,并且支持多次延长。
30秒这个数字值得停下来想一想。以前AI视频普遍只能生成几秒,创作者的工作流是「拼图」,把故事拆成一个个独立镜头,分别生成,再剪辑拼接。代价是角色动作跳跃、场景切换生硬、情绪断档,一条完整叙事被切得七零八落。
30秒意味着什么,一个完整的短剧桥段、一段广告故事、一个MV段落,能在一次生成里连贯讲完。LibTV平台用它做高速追车戏,30秒内人物、车辆、环境高度一致,上车、追逐、特技、爆炸全程连贯,不需要反复抽卡来回调试。创作者Simon_阿文参与过Wan每个大版本的内测,他的评价是这次是「最为惊喜」的一次,除了质感和流畅度,参考素材格式扩充、单次30秒和智能时长都值得称赞。
对做短剧、做广告、做自媒体的人来说,从「生成一个镜头」到「讲述一段完整故事」,是工作流级别的变化,不是参数升级。
真正的杀招,你的PPT和Word直接就是视频脚本
重点来了。Wan3.0首次支持doc、xls、ppt、pdf、md等文档格式直接输入,上传一份产品说明或数据报表,模型自动解析结构、提取关键信息,生成带动态图表、字幕和配音的成片。
我第一次看到这个功能的时候,愣了几秒才反应过来它的分量。
想想过去两年做AI视频的流程。你得先学会写提示词,镜头语言、光影描述、风格关键词,一套学下来比学剪辑还费劲。创作者社区里最热门的帖子永远是「提示词模板大全」,这个现象本身就说明门槛在哪。
文档输入把这个门槛直接拆了。会做PPT的人,理论上就具备了做视频的起点,因为你的PPT本身就包含结构、重点、数据、逻辑,模型自己会读。RunningHub上已经有人演示,丢一份产品PPT进去,出一条带动态图表和配音的商品视频。
我的判断是,文档输入比30秒时长是更重要的升级。因为时长解决的是「能做多长」,文档输入解决的是「谁能做」。前者是能力问题,后者是入口问题。入口下移一级,用户盘子大一圈。
一条30秒视频两块一,成本算法得重新算
价格是我重点核对的部分,先给你摆原始数字。API分三档,480P每秒0.3元、720P每秒0.6元、1080P每秒1.2元,8月24日到9月23日千问平台和百炼限时7折,折后480P最低到每秒0.21元。
算一笔账。一条30秒的480P视频,折后6块3。1080P不打折36元,打折后25块2。对比一下找人做一条30秒的产品介绍视频,市场价几百到几千不等。
但这里我得提醒你别只看单价。产品经理社区那篇评测的观点我认同,按秒计费在长片场景下积少成多不算便宜,一支需要反复迭代的长内容,成本很快上去。它的省,省在「一次生成就是一段完整叙事」,试错次数少了,总体成本才压得下来。如果你习惯了抽卡式创作,几十次抽下来,账单会让你冷静。
用户已经可以用起来了,即日起在阿里云百炼、千问AI平台、万相官网、千问APP都能体验,Flova、LibTV、巨日禄、海艺等平台也同步上线了。
别急着写提示词,先盘一盘你手里有什么
说到这里,说点我自己的判断,也是这篇最想留给你的东西。
大家一直有个默认认知,AI时代做内容,普通人要先学会一堆新技能,提示词工程、镜头语言、参数调优。这个认知可能正在被绕开。Wan3.0的文档输入指了另一条路,你不需要新学什么,你过去十年攒下的PPT、Word、PDF,本身就是视频的原材料。会做文档就会做视频,这中间的翻译工作,模型替你干了。
我把这个变化叫「资产平移」。你手里最值钱的不是学新工具的能力,是那些已经存在的文档资产。一份写得很清楚的产品说明、一套逻辑完整的培训材料、一份有数据的年度总结,这些以前只能躺在文件夹里的东西,现在有了直接变成视频的通道。
对企业宣传、培训、电商、知识分享这些场景,这条通道是真实的。当然要泼冷水,把PPT变成视频容易,把PPT变成有人看的视频,还是得看内容本身。工具解决的是生产,不解决传播。
我的判断和给你的建议
我的判断是,视频生成正在重走一遍图片生成的路,从专业创作者的生产工具,变成所有人的表达工具,而每一次这种转变,最大的红利都归「手里有存量资产的人」,不归「最先学会新工具的人」。
建议分三种人。如果你是企业里负责宣传、培训的,本周就值得拿一份现成PPT去千问平台试一次,成本几块钱,看看你们家的存量文档能不能变成视频资产。如果你是自媒体人或副业党,别急着报提示词课程,先把自己写过的文章、做过的表格翻出来,它们可能就是你的下一批视频选题。如果你是专业视频创作者,重点关注的不是文档输入,是跨镜头一致性和30秒叙事,这两个能力直接决定你的拼接成本降多少。
最后留一个问题给你,你电脑里躺着多少份PPT,如果明天它们都能变成视频,你会先把哪一份变出来?
Neurich聚焦AI工具,每天分享一款我正在关注的AI产品。