素材来源:千问APP公众号、IT之家、界面新闻 | 2026-08-07
说出来你可能不信——把一个PPT扔给AI,出来的是一支视频。
不是图文,不是动画模板,是真正的视频:有运镜、有转场、有叙事。
8月6日晚间,阿里云正式宣布全新一代视频生成模型 Wan3.0 开启公测。今天起,百炼、万镜一刻、万相官网、千问创作PC端等渠道全部开放,千问APP灰度推送。
这一代最狠的变化,不在画质,在输入。
文档成了第五种模态
过去喂给视频模型的,无非四样:文本、图片、音频、视频。
Wan3.0第一次把文档也变成了输入。doc、xls、ppt、pdf、txt、md,连key、pages、numbers这些苹果办公格式都支持。单个文件或链接不超过100MB、50页。
什么意思?你的教学课件、产品演示、业务汇报,可以直接变成视频。
官方给的例子很直观:上传一个智能眼镜产品的PPT,配上一段提示词,出来就是一条完整的形象片。
办公素材到视频之间那条手工剪辑的流水线,被这个模型从中间截断了。
单次30秒,从镜头到故事
生成时长的延展是Wan3.0最直观的升级:单次原生生成30秒。
30秒意味着什么?连续运镜、一镜到底这些复杂镜头语言终于施展得开了。AI视频从"生成一个镜头"走向"讲述一段完整的故事"。
配套的还有两个小功能:智能时长——根据提示词自动推荐合适时长;视频延长——在结尾继续延展剧情走向。
镜头拍完不算完,故事讲完才算完。
图1|Wan3.0公测核心参数与单条视频成本(数据来源:阿里云官方公告)
告别"AI油腻感"
官方这次专门提了人像:文生视频力求"千人千面"——五官、皮肤细节更敏锐,情绪表达自然克制,微表情和肢体动作联动。群像场景里,不同人物的复杂情绪也能分开呈现。
这正是目前视频生成模型最容易被一眼识破的地方。AI人物的"油腻感"、表情的"塑料感",Wan3.0把它当作头号问题来打。
全能参考的一致性也跟上了:角色、道具、声音、空间关系、风格,细粒度维度都能稳定保持。角色换套衣服不串脸,道具换个角度不变形。
视频编辑能力同步升级——支持直接修改画面、剧情与台词,不用推翻重来。
官方也自己留了句实话:声音质感与文字准确度,仍有进步空间。
文档到视频,链路怎么走
把结构化信息变成镜头语言,靠的是模型内部的提示词工程与指令遵循能力——提示词被转化为调度输入、控制表达的中枢。
图2|Wan3.0的"文档→视频"链路:结构化信息直接翻译成镜头语言
视频生成赛道的节奏,变成周更了
7月31日,即梦Seedance 2.5发布;同一天,MiniMax H3带着"手绘即特效"来了。
8月6日,Wan3.0跟上。一周之内三家大厂密集出手,视频生成赛道已经从"月更"卷进"周更"。
但注意阿里这次押注的方向:不是更炫的画面,而是更实用的场景。教学课件、产品演示、动态图表、业务汇报——全是办公场景。
配合定价看更明显:480P只要0.3元/秒,一条30秒的片子9块钱。这个价格瞄准的不是影视工业,是日常生产力。
换个角度说,阿里想把视频生成从"内容工具"变成"办公基建"。
几个值得注意的细节
→ 模态扩张是今年视频模型的统一主线:文本→图片→音频→视频→文档,输入边界每打开一次,使用场景就翻一倍。
→ "从镜头到故事"是时长竞赛的终点逻辑。30秒刚好跨过短视频平台的一条完整叙事线,卡位卡得很准。
→ 文档转视频真正吃掉的是"演示素材再生产"这条流水线——PPT做好了还要找人剪视频的日子,正在被模型压缩。
→ 官方主动承认声音与文字准确度仍有短板,这种自我标注在国产模型公告里不多见。
好了,最后一个问题留给你们——
文档直接变视频,是"AI视频从玩具变工具"的临门一脚,还是办公素材批量变成短视频流水线的开始?
评论区告诉我你的第一反应。