四连发!通义万相重磅开源
第四发更新来了
通义万相2.2正式开源!
具体如下
开源文生视频Wan2.2-T2V-A14B
图生视频Wan2.2-I2V-A14B
统一视频生成Wan2.2-TI2V-5B
文生视频模型和图生视频模型均为业界首个使用MoE架构的视频生成模型,总参数量为27B,激活参数14B;同时,首创电影美学控制系统,光影、色彩、构图、微表情等能力媲美专业电影水平。
即日起,用户可在GitHub、HuggingFace、魔搭社区下载模型和代码,也可在通义万相官网和通义APP直接体验。
开源地址:
- Github:https://github.com/Wan-Video/Wan2.2
- Huggingface:https://huggingface.co/Wan-AI
- 魔搭社区:https://modelscope.cn/organization/Wan-AI
技术亮点
// 率先引入MoE架构视频生成模型
通义万相2.2率先在视频生成扩散模型中引入MoE架构,有效解决视频生成处理Token过长导致的计算资源消耗大问题。
Wan2.2模型推理示意图
Wan2.2-T2V-A14B、Wan2.2-I2V-A14B两款模型均由高噪声专家模型和低噪专家模型组成,分别负责视频的整体布局和细节完善,在同参数规模下,可节省约50%的计算资源消耗,在模型能上,通义万相2.2在复杂运动生成、人物交互、美学表达、复杂运动等维度上也取得了显著提升。
// 数据支持与模型精调
较上一代万相2.1模型,万相2.2模型的训练数据实现了显著扩充与升级,并在训练中引入了专门的美学精调阶段,通过细粒度地训练,使得视频生成的美学属性能够与用户给定的prompt提示词相对应。
万相2.2模型在美学精调阶段创新性提出了「电影级美学控制系统」,直接将光影、色彩、镜头语言三大电影美学元素装进模型。通义团队编码了60多个直观可控的参数,并且可以随意组合,大幅提升电影级画面的制作效率。
例如,用户输入「黄昏」、「柔光」、「边缘光」、「暖色调」「中心构图」等关键词,模型可自动生成金色的落日余晖的浪漫画面;使用「冷色调」、「硬光」、「平衡图」、「低角度」的组合,则可以生成接近科幻片的画面效果。

左:高角度全景/右:低角度中景
// 高压缩与视频生成
此次,通义万相还开源了一款5B小尺寸的统一视频生成模型,单一模型同时支持文生视频和图生视频,可在消费级显卡部署。
该模型采用了高压缩率3D VAE架构,时间与空间压缩比达到高达 41616,信息压缩率提升至 64,均实现了开源模型的最高水平,仅需22G显存(单张消费级显卡)即可在数分钟内生成5秒高清视频,是目前24帧每秒、720P像素级视频生成速度最快的基础模型。
Demo展示






提示词:中全景,在昏暗的走廊里,一名男子手持手电筒向前走。平拍中近景镜头中,他穿着黑色的衣服,手电筒发出的光线照亮了前方的道路。两侧是一排排白色的柜子,上面有着银色的把手。虚化的背景一片漆黑,只有微弱的灯光照亮着这个走廊。
/ END /
声明:本站所有文章,如无特殊说明或标注,均为本站作者原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。本文来自作者自媒体,不代表UIED观点和立场。 如若本站内容侵犯了原著者的合法权益,可联系我们进行处理以减少您的损失。
标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。