推荐Lovart 中文版 - 一站式 AI 设计平台推荐一人企业Vibe Coding社区!热门AI设计工具新品免费AI编程工具 Trae - 智能编码助手Seedance2.5已上线新用户注册即领免费算力
UIED.CN今天偷学哪一招,朋友

生数科技把 AI 视频拉到 4K 了:Vidu Q4 Preview 一次可喂 15 张图、3 段声音

AI 视频现在已经不只是卷:

画面能不能动。

真正进入短剧、广告和影视制作后,创作者更在意的是:

人物演得像不像。

镜头有没有导演感。

动作一快会不会崩。

换一个机位以后,角色还是不是同一个人。

声音、表情和口型能不能配合起来。

10 月 8 日,生数科技正式发布新一代视频旗舰模型的首个预览版本:

Vidu Q4 Preview。

这一代重点围绕三个方向升级:

人物演绎。

镜头语言。

复杂视效。

同时,输出规格直接覆盖:

2K 和 4K。

参考能力也进一步扩大,单次最多可以提供:

15 张参考图片。

以及:

3 段参考音频。

Vidu 想做的已经不只是:

把一张图片变成几秒钟视频。

而是让模型同时理解人物、服装、商品、场景、声音和剧情,再把它们组织成一段更完整的表演。



一、Vidu Q4 Preview 是什么?

Vidu Q4 Preview 是生数科技下一代 Q4 视频模型的首个公开预览版本。

目前官方开放的两种生成模式是:

图生视频

从一张首帧图片出发。

模型根据图片内容和文字提示,继续生成后续动作、镜头与声音。

比较适合:

已经确定开场构图;

已有角色插画;

已有商品主视觉;

想让静态照片自然动起来

的场景。

参考生视频

使用多张图片和参考音频,共同约束生成结果。

比较适合:

角色一致性;

多人短剧;

商品广告;

复杂场景;

品牌视觉;

带固定音色的人物表演。

需要注意,Q4 Preview 当前并没有公开纯文字直接生成视频的 API。

也没有开放:

参考视频输入;

首尾帧生成;

视频编辑

等独立入口。

因此,它现阶段更适合已经拥有图片素材、角色设定或声音参考的创作者。



二、单次支持 3~16 秒视频

按照当前 API 文档,Vidu Q4 Preview 单次支持生成:

3~16 秒视频。

默认时长为:

5 秒。

相比只适合生成一个简单动作的短片段,16 秒已经可以容纳:

人物登场;

一句完整对白;

情绪变化;

镜头推进;

动作爆发;

结尾停顿

等更多内容。

例如一段 12 秒的短剧镜头,可以这样设计:


0~3秒
人物推门进入房间

3~7秒
看到桌上的信件,表情发生变化

7~10秒
镜头推近,人物低声说出台词

10~12秒
窗外传来雷声,人物突然回头

模型需要同时保持:

人物外观;

动作连续性;

情绪变化;

声音节奏;

镜头衔接。

这比单纯让角色“眨眼、转头、走两步”复杂得多。



三、从 540P 一路支持到 4K

Vidu Q4 Preview 当前提供五档输出分辨率:

540P

720P

1080P

2K

4K

其中,2K 和 4K 更适合:

影视预演;

品牌广告;

大屏展示;

高质量商品视频;

专业后期制作。

公开发布信息还提到:

10-bit 色深输出。

相比普通 8-bit 视频,10-bit 可以记录更加丰富的色彩层次。

在以下画面中会更有价值:

天空渐变;

夜景;

霓虹灯;

烟雾;

逆光;

火焰;

粒子特效;

复杂肤色和光影。

不过,4K 只是输出规格。

它并不自动代表:

人物永远不会变脸;

文字一定正确;

所有动作都符合物理规律;

生成结果可以直接交付。

真正用于商业项目时,依然需要逐镜检查人物、商品、文字、Logo、声音和运动细节。



四、最多 15 张图片,可以把人物、服装、场景和商品一起喂进去

Vidu Q4 Preview 的参考生视频最多支持:

15 张参考图片。

这比只提供一张人物图的工作方式灵活很多。

例如制作一段品牌短片时,可以分别提供:


图片1~3
→ 主角不同角度

图片4~5
→ 角色服装与配饰

图片6~8
→ 产品外观和细节

图片9~11
→ 场景和空间风格

图片12~13
→ 光影与色彩参考

图片14~15
→ 构图和品牌视觉

模型再根据提示词,把这些素材重新组合成一段视频。

这对商业创作非常重要。

因为真实项目很少是:

完全凭一句文字从零生成。

更多时候,创作者已经拥有:

人物设定;

品牌资产;

产品图;

场景参考;

服装方案。

模型真正需要做的是:

在保留这些核心元素的基础上,完成新的表演和镜头。



五、15 张参考图不是越多越好

虽然上限达到 15 张,但并不代表每次都应该全部塞满。

如果参考图片之间存在冲突,例如:

同一个角色出现三种发型;

服装颜色不一致;

商品结构不同;

多个场景透视完全冲突,

模型反而可能更难理解创作意图。

更合理的做法是给每一张参考图分配明确作用。

例如在提示词中写清楚:


参考图1、2用于人物面部和发型
参考图3用于服装
参考图4、5用于商品外观
参考图6用于场景
参考图7用于灯光和色调

不要只把十几张图片扔进去,再让模型自己猜:

到底应该参考什么。

参考素材越多,越需要:

清晰的角色分工。



六、最多 3 段参考音频,用声音继续锁定角色

除了视觉参考,Vidu Q4 Preview 还支持最多:

3 段参考音频。

每一段音频当前要求:

3~12 秒。

格式为:

MP3。

单个文件不超过:

50MB。

这些参考音频可以帮助模型保持角色的:

音色;

说话方式;

语气;

情绪;

声音身份。

例如一段三人对话短片,可以分别提供三位角色的声音样本。

模型再根据剧情生成对应对白,让不同人物之间拥有更加明确的声音区分。

这意味着参考一致性开始从:

角色长得像不像。

继续扩展到:

角色说话还是不是同一个人。



七、人物表演是 Q4 Preview 的核心升级

这一代 Vidu 特别强调:

传神表现力。

人物生成过去最常见的问题是:

台词很激动,但脸没有表情。

角色明明很悲伤,身体动作却非常僵硬。

人物跑得很快,眼神和呼吸却完全没有变化。

Vidu Q4 Preview 重点优化了:

眼神;

停顿;

微表情;

肢体动作;

声音语气;

人物情绪

之间的协调。

比如角色听到坏消息后,不应该瞬间摆出一个夸张哭脸。

更加自然的表现可能是:

眼神先停顿;

呼吸发生变化;

嘴角和眉毛轻微移动;

身体动作逐渐变慢;

最后才说出台词。

这种细小变化,决定了 AI 视频看起来是:

一个会动的人物。

还是:

一个真的在表演的角色。



八、文戏和动作戏,都需要不同能力

人物表演并不只指情绪戏。

动作戏同样非常考验模型。

例如:

奔跑;

追逐;

武打;

摔倒;

多人对抗;

高速转身。

这些场景很容易出现:

肢体扭曲;

动作断裂;

人物漂移;

镜头跟不上主体;

前后空间关系混乱。

Q4 Preview 进一步强化高动态场景的运动连续性,希望让人物动作、摄影机运动和场景变化保持更自然的配合。

在实际创作中,提示词也应该避免一次要求太多完全不同的复杂动作。

相比:

角色跳跃、翻滚、拿枪、转身、打斗、爆炸后继续奔跑。

更加合理的方式是:

把动作按照时间顺序和镜头节奏写清楚。



九、动态运镜和切镜进一步加强

Vidu Q4 Preview 还重点升级了:

镜头语言。

包括:

推镜;

拉镜;

跟拍;

环绕;

摇镜;

低机位;

俯拍;

快速切镜;

多镜头衔接。

真正专业的视频,并不是摄像机永远固定在人物正前方。

镜头需要根据剧情和动作发生变化。

例如追逐场景中:


先用远景建立空间
↓
切到侧面跟拍人物奔跑
↓
转入低机位表现速度
↓
快速推近人物表情
↓
切到爆炸后的反应镜头

如果模型只单独处理每个画面,镜头之间很容易缺少逻辑。

Q4 Preview 想进一步提升的,是:

动作、镜头和叙事节奏之间的配合。



十、爆炸、烟火、粒子和能量特效,不再只是贴在画面上

复杂视觉特效也是这一代的重点方向。

包括:

爆炸;

烟火;

火焰;

烟雾;

粒子;

能量;

光效;

高速破碎。

过去很多 AI 视频中的特效,看起来像是在画面上额外覆盖了一层素材。

爆炸没有影响人物动作。

光线没有照亮周围环境。

烟雾和空间没有正确关系。

Q4 Preview 更强调:

特效与人物、场景和镜头的结合。

例如爆炸发生时,模型需要同时处理:

人物反应;

空气和烟雾变化;

周围物体运动;

瞬间光线;

摄影机震动;

声音效果。

复杂视效真正自然的关键,不是粒子越多越好。

而是:

它是否真的发生在这个世界里。



十一、默认可以直接生成有声视频

Vidu Q4 Preview 当前支持原生音画输出。

API 中:


audio = true

是默认设置。

开启后,模型可以同时生成:

人物对白;

动作音效;

环境声音。

例如:

人物推门时出现门轴声;

脚步与走路动作同步;

爆炸和冲击画面对应;

角色说话与表演节奏结合。

用户也可以将音频关闭,生成静音视频,再进入专业后期流程添加声音。

需要注意,参考音频与生成音频不是同一个概念。

参考音频主要用于:

引导角色音色和声音特征。

最终音轨则由模型结合剧情、对白和动作重新生成。



十二、参考生视频支持多种常用画幅

Vidu Q4 Preview 的参考生视频目前支持:

1:1

9:16

16:9

3:4

4:3

几种画幅。

这基本覆盖了:

方形社交媒体内容;

竖屏短视频;

横屏广告;

小红书图文视频;

传统画幅内容。

例如:

9:16 适合抖音、视频号和 Reels。

16:9 适合 YouTube、品牌视频和影视内容。

3:4 可以用于部分社交媒体和竖版视觉创作。

同一套角色和场景,可以围绕不同发布渠道分别生成对应版本。



十三、API 已经开放,模型 ID 为 viduq4-preview

开发者目前可以通过 Vidu 开放平台调用 Q4 Preview。

模型 ID 为:


viduq4-preview

图生视频接口为:


POST /ent/v2/img2video

参考生视频接口为:


POST /ent/v2/reference2video

生成任务采用异步模式。

提交任务后,平台会返回任务 ID。

开发者再通过查询接口获取任务状态和最终结果。

这比较适合:

AI 视频平台;

短剧生产系统;

广告素材工具;

电商内容平台;

企业批量视频工作流。

提示词当前最多支持:

20000 个字符。

足够容纳比较完整的:

角色设定;

镜头要求;

动作顺序;

对白;

声音;

特效;

负面约束。



十四、首发宣传价 0.09 元/秒起,但不要直接套到所有规格

生数科技对外公布的首发优惠价格为:

0.09 元/秒起。

这里的关键词是:

“起”。

不同产品入口、分辨率和套餐,实际价格并不相同。

官方 API 当前采用积分计费。

在公开积分表中,不同分辨率每秒消耗分别为:


540P
9积分 / 秒

720P
19积分 / 秒

1080P
24积分 / 秒

2K
38积分 / 秒

4K
78积分 / 秒

因此不能简单理解成:

所有 4K 视频都只需要 0.09 元一秒。

批量调用以前,应该在控制台确认:

当前积分单价;

生成模式;

分辨率;

时长;

活动折扣;

最终预估消耗。



十五、最适合哪些场景?

AI 短剧与漫剧

多张人物设定图和声音参考,可以帮助保持角色视觉与音色一致。

广告营销

同时提供商品、模特、服装、场景和品牌参考,生成不同创意版本。

电商视频

围绕真实商品图片,生成使用场景、模特展示和产品特写。

影视预演

提前测试演员动作、镜头、场景和视觉特效,降低正式制作前的试错成本。

虚拟角色

使用人物多角度设定和声音参考,生成更加统一的角色内容。

社交媒体内容

根据 9:16、3:4、1:1 等画幅,批量制作不同平台的短视频。



十六、Preview 版本目前还有哪些边界?

首先,它仍然是:

Preview。

后续正式版的能力、价格和接口可能继续调整。

其次,当前 API 主要支持:

图生视频;

参考生视频。

不应把 Vidu 平台其他模型或功能,默认算到 Q4 Preview 身上。

例如目前没有公开:

纯文生视频;

视频参考输入;

独立首尾帧模式;

视频编辑入口。

第三,4K 输出不代表所有细节都一定正确。

尤其需要检查:

小字号文字;

品牌 Logo;

商品结构;

人物手部;

复杂多人动作;

口型和对白;

长镜头中的身份一致性。

真正进入生产环境时,依然应该先建立:

短片测试;

素材规范;

验收标准;

人工质检;

失败重试

等完整流程。



结语

Vidu Q4 Preview 这次可以记住几个核心数字:

最多 15 张参考图片。

最多 3 段参考音频。

单次生成 3~16 秒。

最高 4K 输出。

支持 10-bit 色深。

提示词最多 20000 字符。

同时支持:

人物情绪表演。

动态运镜。

复杂动作。

爆炸、烟火、粒子和能量特效。

原生对白与音效。

但相比这些参数,更值得关注的是:

Vidu 正在把 AI 视频的控制方式,从一句简单 Prompt,继续扩展成:


人物长什么样
+
穿什么衣服
+
使用什么商品
+
站在什么场景
+
说话是什么声音
+
做什么动作
+
镜头怎么运动
+
特效如何出现

以前 AI 视频更像是在抽一个结果。

现在则越来越接近:

给模型完整的演员、场景、声音和导演要求,再让它完成一段表演。

Q4 Preview 还不是最终的 Vidu Q4。

但它已经让我们看到,新一代视频模型竞争的重点,正在从:

“能不能生成视频”

继续走向:

“能不能真正把人物演好、把镜头讲清楚。”

相关链接


Vidu 官网
https://www.vidu.com/

Vidu 开放平台
https://platform.vidu.cn/

Vidu 模型地图
https://platform.vidu.cn/models

Vidu Q4 Preview 图生视频 API
https://platform.vidu.cn/docs/api-reference/video-models/vidu-q4-preview/image-to-video

Vidu Q4 Preview 参考生视频 API
https://platform.vidu.cn/docs/api-reference/video-models/vidu-q4-preview/reference-to-video

Vidu API 产品价格
https://platform.vidu.cn/pricing

Vidu API 价格文档
https://platform.vidu.cn/docs/pricing

Vidu API 更新记录
https://platform.vidu.com/docs/api-reference/updates

生数科技官网
https://www.shengshu.com/


标签

评论 0

最新评论

登录后发布评论并参与互动。

暂无评论,欢迎抢沙发。

推荐阅读

查看更多