万相 Wan3.0 正式上线:一次生成 30 秒视频,连 PPT、PDF 都能直接变成创作素材

AI 视频终于开始从:
“生成一个几秒钟的片段”
往:
“直接做一段完整内容”
继续走了。
8 月 24 日,阿里正式上线新一代视频生成模型:
Wan3.0。
这次最直观的升级就是:
单次最长 30 秒。
而且不是只能输入一句 Prompt。
现在图片、视频、音频,甚至 DOC、XLS、PPT、PDF、MD 文档和网页链接,都可以直接作为创作参考。
简单理解:
以前是:
文字 → 视频。
现在越来越接近:
什么素材都可以 → 视频。
一、一次可以直接生成 30 秒
过去 AI 视频最大的问题之一就是:
太短。
5 秒一个片段。
10 秒一个片段。
真正想做短剧、广告或者 MV,往往需要自己生成大量素材,再进入剪辑软件重新拼接。
Wan3.0 现在把单次生成上限提高到了:
30 秒。
而且支持:
480P;
720P;
1080P。
对于短视频来说,30 秒已经足够完成一个相对完整的小段落。
例如:
开场环境;
人物出现;
镜头推进;
人物动作;
对白;
镜头切换;
最后落到产品。
可以全部放在一次生成中完成。
二、30 秒真正难的是“一致性”
单纯让模型多生成 20 秒其实并不是最难的。
真正麻烦的是:
时间越长,越容易崩。
比如:
第 3 秒还是这个人;
第 15 秒脸变了;
第 20 秒衣服颜色又换了。
或者汽车从一个镜头切到下一个镜头以后:
车型直接变掉。
所以 Wan3.0 正式版重点继续增强:
跨镜头角色一致性、场景一致性以及主体稳定性。
这对于:
短剧;
影视;
广告;
MV
特别重要。
AI 视频真正想进入生产流程,不能只保证:
第一帧好看。
而是整段视频里:
人、物、场景都得保持住。
三、PPT、PDF 现在也能直接拿来生成视频
这次我觉得很实用的一个功能,是:
文档输入。
Wan3.0 支持:
DOC;
XLS;
PPT;
PDF;
MD
等文件作为参考输入。
比如你有一份:
产品介绍 PPT。
以前的流程可能是:
阅读 PPT
↓
提炼卖点
↓
写视频脚本
↓
拆分镜头
↓
准备素材
↓
生成视频现在可以直接把 PPT 交给模型,让它理解里面的内容,再结合 Prompt 生成视频。
对于:
产品宣传;
教育课件;
企业介绍;
电商;
行业报告
这类内容尤其方便。
四、连网页都能作为视频参考
除了文档,Wan3.0 还支持:
公开网页链接。
比如给一个产品官网,再告诉模型:
根据网页中的产品信息,制作一段 20 秒科技产品发布短片,重点展示产品外观、三项核心功能和品牌视觉。
模型可以先理解网页内容,再继续进行视频创作。
这时候 AI 视频的输入已经不只是:
一张参考图。
而是:
文字
+
图片
+
视频
+
音频
+
文档
+
网页
↓
Wan3.0
↓
视频这也是所谓:
All-in-One 全能参考。
五、文生、图生、首尾帧、参考视频统一到一个模型
以前做 AI 视频经常需要先决定:
我到底该用哪个模型?
文生视频一个模型。
图生视频另一个。
首尾帧又一个。
参考视频再换一个。
Wan3.0 现在使用统一的:
wan3.0-video
把多个能力整合在一起。
目前可以覆盖:
文生视频
图生视频
首帧生视频
首尾帧生视频
参考生视频
再结合音频、文件和网页等输入。
对于开发者来说也更加简单:
不用为不同视频任务维护一堆完全不同的模型接口。
六、声音也是直接生成的一部分
Wan3.0 默认可以生成:
有声视频。
不是画面生成以后再单独找一个工具配音。
而是让:
画面;
对白;
环境声音;
整体节奏
一起进入视频生成过程。
例如:
夜晚东京街头,一辆跑车快速驶过湿润路面,轮胎卷起水花,远处传来汽车发动机声和城市环境音。
模型不仅要画出画面。
还要让:
发动机;
轮胎;
街道环境
跟视频运动对应起来。
这对于提升成片感非常重要。
七、短剧和影视会是 Wan3.0 很重要的场景
30 秒以后,AI 视频的使用场景会明显发生变化。
以前比较适合:
一个视觉镜头。
以后可以尝试:
一小段剧情。
比如:
0–5 秒建立环境,女孩进入咖啡馆;5–12 秒看到桌面上的信;12–20 秒特写人物神情;20–27 秒打开信件;27–30 秒镜头停在信纸内容。
这已经有明确:
起承转合。
所以 Wan3.0 在公测期间已经开始进入:
AI 短剧;
影视制作;
MV
等内容生产流程。
对 AI 视频来说,这比单纯增加分辨率更值得关注。
八、广告和电商也会更方便
广告最需要的是:
可控。
比如一个产品不能:
第一镜头是黑色;
下一镜头突然变成银色。
Logo 也不能变。
产品结构更不能乱。
Wan3.0 对参考图和主体一致性的提升,就很适合这一类场景。
例如:
上传一张产品图。
然后说:
生成一段 15 秒运动耳机广告。产品外观、Logo、颜色和结构必须保持与参考图一致。前 5 秒展示运动员跑步,中间展示产品特写,最后 3 秒产品悬浮在黑色背景中。
相比完全依靠文字描述:
参考素材会让结果更容易控制。
九、文旅宣传也会是一个高频场景
文旅视频通常需要:
风景;
建筑;
人物;
历史文化;
镜头运动;
旁白和氛围音乐。
过去制作成本比较高。
现在可以把:
景区资料;
旅游介绍 PDF;
真实照片;
宣传文案
全部作为参考。
再生成:
城市宣传;
景区短片;
文化故事;
旅行视频。
尤其结合 30 秒多镜头能力后,一次生成已经可以完成一条比较完整的社交媒体宣传内容。
十、API 分三档价格
Wan3.0 API 目前按照输出分辨率计费。
国内标准价格为:
480P:0.3 元 / 秒
720P:0.6 元 / 秒
1080P:1.2 元 / 秒
如果直接生成一段 30 秒视频,按照标准价格计算:
480P 大约:
9 元
720P 大约:
18 元
1080P 大约:
36 元。
需要注意,如果使用视频作为输入,部分场景会同时计算输入视频与输出视频时长。
十一、8 月 24 日至 9 月 23 日限时 7 折
Wan3.0 正式上线后,阿里云百炼和千问AI平台同步开启 API 限时优惠。
活动时间:
2026 年 8 月 24 日—9 月 23 日。
7 折后的价格分别为:
480P:0.21 元 / 秒
720P:0.42 元 / 秒
1080P:0.84 元 / 秒
换算成一段 30 秒视频:
480P:
约 6.3 元
720P:
约 12.6 元
1080P:
约 25.2 元。
如果是大量生产 AI 短剧、广告或者视频素材,这个差距会比较明显。
十二、Wan3.0 已经不只是一个“视频抽卡模型”
我觉得 Wan3.0 这次最值得看的,不只是:
30 秒。
真正的变化是视频模型开始从:
给我生成一个镜头。
继续走到:
理解我手上的各种资料,然后帮我完成一段视频。
输入已经可以包括:
文本;
图片;
视频;
声音;
PDF;
PPT;
网页。
输出又可以包含:
多镜头;
人物;
声音;
连续剧情。
这越来越接近一个:
AI 视频创作引擎。
结语
Wan3.0 正式版可以记住几个重点:
单次最长 30 秒。
最高 1080P。
支持文本、图片、视频、音频。
支持 DOC、XLS、PPT、PDF、MD。
支持网页链接。
文生、图生、首尾帧和参考视频统一。
跨镜头一致性进一步提升。
以及:
API 首月限时 7 折。
以前 AI 视频更像:
生成素材。
现在随着时长、参考一致性、多模态输入和音频能力一起提升,它开始越来越适合直接参与:
短剧;
广告;
MV;
文旅;
电商
这些真正的内容生产流程。
30 秒也许只是一个数字。
但当一次生成开始可以承载:
多个镜头 + 人物一致性 + 声音 + 完整叙事
以后,AI 视频的玩法确实会比以前丰富很多。
相关链接
万相 Wan3.0 官方体验
阿里云百炼 Wan3.0 专题
https://www.aliyun.com/benefit/scene/wan
Wan3.0 官方模型文档
https://help.aliyun.com/zh/model-studio/wan3-0-video
Wan3.0 文生视频使用文档
https://help.aliyun.com/zh/model-studio/text-to-video-guide
Wan3.0 API 文档
https://help.aliyun.com/zh/model-studio/wan3-video-generation-api-reference
阿里云百炼模型价格
https://help.aliyun.com/zh/model-studio/model-pricing
阿里云百炼
https://www.aliyun.com/product/bailian
千问AI平台
标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。