
阿里 Wan3.0 今天开启公测。单次可生成 30 秒视频,支持文本、图片、音频、视频之外,还能直接读取 URL、PDF、PPT 等文档。对做营销、培训、产品演示的团队来说,这意味着大量办公素材可以一步转成动态视频。
做短视频的人都有过这种经历。你写了一段很棒的 prompt,模型给你 5 秒高光片段,画面好看,动作也对,但一放到项目里就发现:不够讲完整件事。想续一段,人物换了脸;想接镜头,场景对不上。到头来只能把 AI 当成“素材库”,真正的叙事还得靠人工剪。
阿里今天把 Wan3.0 放进公测。它要解决的正是这个断层:不是多出几秒画面,而是让 AI 视频从“片段生成”变成“可以承接工作流”。
Wan3.0 官方把“原生 30 秒时长”放在能力介绍的显眼位置。上一代 Wan2.7-Video 单段上限是 15 秒,这也是目前主流 AI 视频工具的常见区间。跳到 30 秒,意味着一次生成就能装下一段相对完整的叙事,而不是只能出“一个好看的镜头”。
时长带来的变化很实际。15 秒里,你通常只能做一个动作、一个转场、一个情绪点。30 秒则可以塞进连续运镜、一镜到底,或者一小段有起承转合的剧情。阿里官方在发布稿里举了一个例子:一个戴黑色棒球帽的少年在 30 秒内完成一段奇幻之旅。这种镜头如果拆成两段生成,中间衔接很容易穿帮;一次生成 30 秒,动作的连贯性和空间的连续性都更有保障。
对广告片、教学演示、产品剧情片来说,这意味着少了大量分段生成和后期拼接的活儿。你不再需要抽十几条 5 秒片段,再逐条挑选、补镜头、对齐人物。创作者可以把精力放在提示词和整体叙事上,而不是跟拼接作斗争。
Wan3.0 还加了一个“智能时长”功能。系统会根据提示词自动推荐一个合适长度,不用你每次去猜 5 秒、10 秒还是 30 秒。如果一次不够,它支持视频延长,把故事线继续往下推。这个功能组合起来,才称得上“可延续的创作”,而不是“一次性抽卡”。当 AI 视频能从“出片段”变成“接工作流”,它的使用场景才会真正打开。
这次升级里生产味很浓的是输入方式。Wan3.0 在文本、图片、音频、视频四种模态之外,首次支持 doc、xls、ppt、pdf、txt、key、pages、numbers 和 md 等格式。也就是说,一份产品规格表、一页 PPT、一个网页链接,都能直接变成视频素材。
阿里云官方举了一个例子:上传一份智能眼镜的 PPT,配上提示词,就能得到一个完整的品牌形象片。这正好对应了你提到的“从规格表到概念广告”。过去这种需求需要设计师先做分镜、写脚本、找素材、做动画,现在模型把中间环节吞掉了。
URL 输入也同样实用。你可以把产品官网、电商详情页、博客文章或 Help Center 文档的链接丢进去,模型读取页面结构后生成一段讲解视频。对 SaaS 公司来说,这意味着一份新功能说明文档可以直接变成 30 秒产品介绍片,不需要再专门拍屏幕演示。对内容运营团队来说,这也意味着已有的图文资产可以快速复用为视频资产。
输入有一些硬边界需要留意。文件大小不能超过 100MB,页数不能超过 50 页,每次只能输入一个文件或一个链接。这对普通办公文档足够,但如果你丢的是一份 200 页的白皮书,需要先拆一下。链接输入则受网页复杂程度影响,如果页面里嵌了大量交互组件或弹窗,提取效果可能会打折扣。
AI 视频能不能商用,从来不只是画质问题,而是“这一帧和下一帧是不是同一个东西”。Wan3.0 把“像素级一致性保持”作为核心卖点,覆盖角色、道具、场景、风格四个维度。
角色层面,官方说法是“千人千面”。模型会刻画五官、皮肤、发型、形体、服饰、配饰这些细粒度特征,群像场景里也能让不同人物保持各自的情绪。对短剧、广告、虚拟博主来说,这意味着同一个人可以连续出现在多个镜头里,不会每次生成都是一张新脸。
道具和场景层面,多角度外观、硬件结构、Logo、材质细节、角色站位、机位视角都会被约束。这对产品展示片很关键。比如你要拍一款新手机,手机背面的 Logo、边框反光、握持角度在连续镜头里不能漂移。
风格层面,Wan3.0 支持影视拍摄调性的稳定渲染。官方提到赛璐璐风格的 2D 动画、东方仙山的水墨奇幻、西海岸街头流行主义等不同风格都能保持统一。多风格混用时也不容易互相串味。
Wan3.0 对数字化信息的处理也有升级。万相官网把“超强文字渲染”单列出来:支持超长文本、12 国语言,图表、公式、信息图都能稳定输出。阿里官方英文稿件里提到,模型可以“accurately present stable software user interfaces and motion graphics”,也就是说 UI 交互动画、软件功能演示这类内容也能接得住。
这个能力对 B 端产品演示很关键。比如你要给一款新的项目管理工具做宣传视频,可以直接上传界面截图或产品文档,让模型生成一段带高亮、转场、文字标注的功能演示。信息图和动态图表也能被稳定渲染,避免以往 AI 视频里文字乱码、UI 漂移的问题。
声音方面,官方说法是“自然的多语言语音输出”。环境音、对白、效果音会同步生成,而不是后期贴上去。这意味着一段产品片可以自带旁白和背景音乐,减少后期配音成本。不过阿里云官方也坦承:声音质感和文字准确度方面仍有进步空间。这一点值得写入评估清单,不要期待它一次性替代专业配音和字幕校对。
Wan3.0 已经在阿里云百炼、万镜一刻、万相官网、千问创作 PC 端开启公测,千问 APP 灰度开放。不同入口侧重点不同:百炼和 Model Studio 更适合开发者和技术团队调试;万相官网和千问创作 PC 端更偏向创作者直接上手;万镜一刻和千问 APP 则面向移动端和快速体验。API 价格方面,480P/720P/1080P 分别是 0.3/0.6/1.2 元/秒。
算一笔账。如果你生成一条 10 秒的 720P 产品片,成本是 6 元;30 秒的 720P 成片,成本 18 元;同分辨率 1080P 则要 36 元。对需要批量出片、快速改版的营销团队来说,这个价格已经能进入试算范围。但对个人副业者或学生来说,做一条 30 秒 1080P 视频 36 元,仍然要先想清楚值不值。如果一天需要出 20 条 30 秒 720P 视频,单日成本约 360 元;换成 1080P 则要 720 元,批量生产前先确认 ROI。
API 接口目前还没全量开放,官方说法是“将于近期全量开放”。现在更适合先去各平台体验入口试跑几条片子,验证效果后再等 API 接入自动化流程。
从目前公开的信息看,Wan3.0 适合三类场景先试。
一类是广告营销。家电、彩妆、汽车、快消、3C、服饰、软件等行业,都可以把产品图加一份 Word/PPT 介绍,直接生成从展示到品牌叙事的短片。不需要先写脚本、找模特、租场地,出片速度会快很多。比如一款新手机上市,市场部可以把产品规格页和卖点 PPT 丢给模型,半小时内拿到几条不同风格的 30 秒预热片,用于 A/B 测试。
二类是教育培训。课件 PPT、产品培训材料、业务汇报文档,直接转成带人出镜或动画演示的视频。对需要高频更新课程内容的机构来说,这能省掉重新录制和剪辑的成本。一门课程的知识点更新后,讲师不再需要重拍整节课,只需更新文档再生成视频即可。
三类是产品与设计创意。UI 交互演示、软件功能动画、数据可视化,可以保留设计审美和质感,直接升华为动态作品。产品经理做原型验证、设计师做动效提案,都能用得上。例如一个数据 dashboard 的交互说明,可以生成一段带鼠标高亮和转场的演示视频,直接放进 PRD 或客户汇报里。对设计团队来说,这相当于把高保真原型和演示动画的合成环节提前到了创意阶段。
头一个限制是 API 还没全量。现在主要是平台体验入口,批量自动化要等后续接口开放。如果你需要把它嵌进现有工作流,得先确认接入时间表。目前可以先在各平台跑几条样片,验证风格一致性和文字准确度后再做接入决策。
二个限制是文件有大小和页数限制。100MB、50 页以内,一次只能传一个文件或一个链接。大文档要拆分,复杂网页可能需要提炼核心内容。建议先把文档里真正要表达的核心页提炼出来,再上传,而不是把整个手册丢进去。
三个限制是声音和文字还不够完美。官方自己说了声音质感和文字准确度有提升空间。正式商用前,配音和字幕仍需人工检查,尤其是品牌名、专业术语、多语言内容。
另外要算清成本。720P 0.6 元/秒,一条 30 秒视频 18 元;1080P 1.2 元/秒,同长度 36 元。如果一条广告片需要反复迭代十版,成本会快速累加。建议先用 480P 或 720P 做内部评审,定稿后再上 1080P。
Wan3.0 的升级方向很清晰:更长、更稳、更开放输入。它不再只是帮你生成一段好看的画面,而是试图承接从文档到成片的完整链路。
当然这还不意味着剪辑师、导演、设计师会被取代。相反,它把重复劳动压缩后,人才有机会回到真正需要判断的地方:故事怎么讲、节奏怎么控、品牌调性怎么定。AI 负责把素材动起来,人负责决定动成什么样。
从 Wan1.0 到 Wan3.0,万相模型家族一共迭代了 8 个版本。这一次的明显不同在于,官方不再只讲画面多炫,而是强调“面向生产力场景”和“可投入生产”。当行业还在争论 AI 视频能不能替代实拍时,Wan3.0 已经在解决“怎么把 AI 视频放进真实工作流”这个问题。
末了问你一句:如果你能把手里的一份 PPT 或一个产品页直接变成 30 秒视频,你想先拿哪份材料试?欢迎在评论区聊聊,顺手点个在看,让更多人看到这个新工具。
既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,
如果想第一时间收到推送,也可以给我个星标⭐
~谢谢你看我的文章,我们,下次再见。
/ 作者 浚枢
神级技能,微软把训练神经网络的方法搬到了 Skill 优化上:52/52 全胜,最强提升 +58 分
不用显卡、不花云钱:Gemma 4 26B 在任意 M 系列 Mac 上只要约 2GB 内存
微软发布 MAI-Cyber-1-Flash:137B 总参 / 5B 激活的小模型,在 CyberGym 拿下了 95.95% 的成绩
Playwright 可以卸了,这两个开源 Skill 免费而且自带反检测
神级Skill:一句话把网站部署上线,服务器不用买,域名不用配
MiniMax H3 杀到 Artificial Analysis 编辑榜头名:开源权重一旦放出来,最强开源视频模型换人
M5 Mac上跑 80B Qwen3-Next 、iPhone 17上跑 35B :Swiftlet 这套 MoE 流式方案到底怎么分配的
Alizila 官方稿件:Alibaba Unveils Wan3.0 with Twice as Long Video Outputs from a Richer Variety of Inputshttps://www.alizila.com/alibaba-unveils-wan3-0-with-twice-as-long-video-outputs-from-a-richer-variety-of-inputs
万相官网(能力介绍与入口)https://wanxiang.aliyun.com
Wan 国际官网https://wan.video