生数科技把 AI 视频拉到 4K 了:Vidu Q4 Preview 一次可喂 15 张图、3 段声音

AI 视频现在已经不只是卷:
画面能不能动。
真正进入短剧、广告和影视制作后,创作者更在意的是:
人物演得像不像。
镜头有没有导演感。
动作一快会不会崩。
换一个机位以后,角色还是不是同一个人。
声音、表情和口型能不能配合起来。
10 月 8 日,生数科技正式发布新一代视频旗舰模型的首个预览版本:
Vidu Q4 Preview。
这一代重点围绕三个方向升级:
人物演绎。
镜头语言。
复杂视效。
同时,输出规格直接覆盖:
2K 和 4K。
参考能力也进一步扩大,单次最多可以提供:
15 张参考图片。
以及:
3 段参考音频。
Vidu 想做的已经不只是:
把一张图片变成几秒钟视频。
而是让模型同时理解人物、服装、商品、场景、声音和剧情,再把它们组织成一段更完整的表演。
一、Vidu Q4 Preview 是什么?
Vidu Q4 Preview 是生数科技下一代 Q4 视频模型的首个公开预览版本。
目前官方开放的两种生成模式是:
图生视频
从一张首帧图片出发。
模型根据图片内容和文字提示,继续生成后续动作、镜头与声音。
比较适合:
已经确定开场构图;
已有角色插画;
已有商品主视觉;
想让静态照片自然动起来
的场景。
参考生视频
使用多张图片和参考音频,共同约束生成结果。
比较适合:
角色一致性;
多人短剧;
商品广告;
复杂场景;
品牌视觉;
带固定音色的人物表演。
需要注意,Q4 Preview 当前并没有公开纯文字直接生成视频的 API。
也没有开放:
参考视频输入;
首尾帧生成;
视频编辑
等独立入口。
因此,它现阶段更适合已经拥有图片素材、角色设定或声音参考的创作者。
二、单次支持 3~16 秒视频
按照当前 API 文档,Vidu Q4 Preview 单次支持生成:
3~16 秒视频。
默认时长为:
5 秒。
相比只适合生成一个简单动作的短片段,16 秒已经可以容纳:
人物登场;
一句完整对白;
情绪变化;
镜头推进;
动作爆发;
结尾停顿
等更多内容。
例如一段 12 秒的短剧镜头,可以这样设计:
0~3秒
人物推门进入房间
3~7秒
看到桌上的信件,表情发生变化
7~10秒
镜头推近,人物低声说出台词
10~12秒
窗外传来雷声,人物突然回头模型需要同时保持:
人物外观;
动作连续性;
情绪变化;
声音节奏;
镜头衔接。
这比单纯让角色“眨眼、转头、走两步”复杂得多。
三、从 540P 一路支持到 4K
Vidu Q4 Preview 当前提供五档输出分辨率:
540P
720P
1080P
2K
4K
其中,2K 和 4K 更适合:
影视预演;
品牌广告;
大屏展示;
高质量商品视频;
专业后期制作。
公开发布信息还提到:
10-bit 色深输出。
相比普通 8-bit 视频,10-bit 可以记录更加丰富的色彩层次。
在以下画面中会更有价值:
天空渐变;
夜景;
霓虹灯;
烟雾;
逆光;
火焰;
粒子特效;
复杂肤色和光影。
不过,4K 只是输出规格。
它并不自动代表:
人物永远不会变脸;
文字一定正确;
所有动作都符合物理规律;
生成结果可以直接交付。
真正用于商业项目时,依然需要逐镜检查人物、商品、文字、Logo、声音和运动细节。
四、最多 15 张图片,可以把人物、服装、场景和商品一起喂进去
Vidu Q4 Preview 的参考生视频最多支持:
15 张参考图片。
这比只提供一张人物图的工作方式灵活很多。
例如制作一段品牌短片时,可以分别提供:
图片1~3
→ 主角不同角度
图片4~5
→ 角色服装与配饰
图片6~8
→ 产品外观和细节
图片9~11
→ 场景和空间风格
图片12~13
→ 光影与色彩参考
图片14~15
→ 构图和品牌视觉模型再根据提示词,把这些素材重新组合成一段视频。
这对商业创作非常重要。
因为真实项目很少是:
完全凭一句文字从零生成。
更多时候,创作者已经拥有:
人物设定;
品牌资产;
产品图;
场景参考;
服装方案。
模型真正需要做的是:
在保留这些核心元素的基础上,完成新的表演和镜头。
五、15 张参考图不是越多越好
虽然上限达到 15 张,但并不代表每次都应该全部塞满。
如果参考图片之间存在冲突,例如:
同一个角色出现三种发型;
服装颜色不一致;
商品结构不同;
多个场景透视完全冲突,
模型反而可能更难理解创作意图。
更合理的做法是给每一张参考图分配明确作用。
例如在提示词中写清楚:
参考图1、2用于人物面部和发型
参考图3用于服装
参考图4、5用于商品外观
参考图6用于场景
参考图7用于灯光和色调不要只把十几张图片扔进去,再让模型自己猜:
到底应该参考什么。
参考素材越多,越需要:
清晰的角色分工。
六、最多 3 段参考音频,用声音继续锁定角色
除了视觉参考,Vidu Q4 Preview 还支持最多:
3 段参考音频。
每一段音频当前要求:
3~12 秒。
格式为:
MP3。
单个文件不超过:
50MB。
这些参考音频可以帮助模型保持角色的:
音色;
说话方式;
语气;
情绪;
声音身份。
例如一段三人对话短片,可以分别提供三位角色的声音样本。
模型再根据剧情生成对应对白,让不同人物之间拥有更加明确的声音区分。
这意味着参考一致性开始从:
角色长得像不像。
继续扩展到:
角色说话还是不是同一个人。
七、人物表演是 Q4 Preview 的核心升级
这一代 Vidu 特别强调:
传神表现力。
人物生成过去最常见的问题是:
台词很激动,但脸没有表情。
角色明明很悲伤,身体动作却非常僵硬。
人物跑得很快,眼神和呼吸却完全没有变化。
Vidu Q4 Preview 重点优化了:
眼神;
停顿;
微表情;
肢体动作;
声音语气;
人物情绪
之间的协调。
比如角色听到坏消息后,不应该瞬间摆出一个夸张哭脸。
更加自然的表现可能是:
眼神先停顿;
呼吸发生变化;
嘴角和眉毛轻微移动;
身体动作逐渐变慢;
最后才说出台词。
这种细小变化,决定了 AI 视频看起来是:
一个会动的人物。
还是:
一个真的在表演的角色。
八、文戏和动作戏,都需要不同能力
人物表演并不只指情绪戏。
动作戏同样非常考验模型。
例如:
奔跑;
追逐;
武打;
摔倒;
多人对抗;
高速转身。
这些场景很容易出现:
肢体扭曲;
动作断裂;
人物漂移;
镜头跟不上主体;
前后空间关系混乱。
Q4 Preview 进一步强化高动态场景的运动连续性,希望让人物动作、摄影机运动和场景变化保持更自然的配合。
在实际创作中,提示词也应该避免一次要求太多完全不同的复杂动作。
相比:
角色跳跃、翻滚、拿枪、转身、打斗、爆炸后继续奔跑。
更加合理的方式是:
把动作按照时间顺序和镜头节奏写清楚。
九、动态运镜和切镜进一步加强
Vidu Q4 Preview 还重点升级了:
镜头语言。
包括:
推镜;
拉镜;
跟拍;
环绕;
摇镜;
低机位;
俯拍;
快速切镜;
多镜头衔接。
真正专业的视频,并不是摄像机永远固定在人物正前方。
镜头需要根据剧情和动作发生变化。
例如追逐场景中:
先用远景建立空间
↓
切到侧面跟拍人物奔跑
↓
转入低机位表现速度
↓
快速推近人物表情
↓
切到爆炸后的反应镜头如果模型只单独处理每个画面,镜头之间很容易缺少逻辑。
Q4 Preview 想进一步提升的,是:
动作、镜头和叙事节奏之间的配合。
十、爆炸、烟火、粒子和能量特效,不再只是贴在画面上
复杂视觉特效也是这一代的重点方向。
包括:
爆炸;
烟火;
火焰;
烟雾;
粒子;
能量;
光效;
高速破碎。
过去很多 AI 视频中的特效,看起来像是在画面上额外覆盖了一层素材。
爆炸没有影响人物动作。
光线没有照亮周围环境。
烟雾和空间没有正确关系。
Q4 Preview 更强调:
特效与人物、场景和镜头的结合。
例如爆炸发生时,模型需要同时处理:
人物反应;
空气和烟雾变化;
周围物体运动;
瞬间光线;
摄影机震动;
声音效果。
复杂视效真正自然的关键,不是粒子越多越好。
而是:
它是否真的发生在这个世界里。
十一、默认可以直接生成有声视频
Vidu Q4 Preview 当前支持原生音画输出。
API 中:
audio = true是默认设置。
开启后,模型可以同时生成:
人物对白;
动作音效;
环境声音。
例如:
人物推门时出现门轴声;
脚步与走路动作同步;
爆炸和冲击画面对应;
角色说话与表演节奏结合。
用户也可以将音频关闭,生成静音视频,再进入专业后期流程添加声音。
需要注意,参考音频与生成音频不是同一个概念。
参考音频主要用于:
引导角色音色和声音特征。
最终音轨则由模型结合剧情、对白和动作重新生成。
十二、参考生视频支持多种常用画幅
Vidu Q4 Preview 的参考生视频目前支持:
1:1
9:16
16:9
3:4
4:3
几种画幅。
这基本覆盖了:
方形社交媒体内容;
竖屏短视频;
横屏广告;
小红书图文视频;
传统画幅内容。
例如:
9:16 适合抖音、视频号和 Reels。
16:9 适合 YouTube、品牌视频和影视内容。
3:4 可以用于部分社交媒体和竖版视觉创作。
同一套角色和场景,可以围绕不同发布渠道分别生成对应版本。
十三、API 已经开放,模型 ID 为 viduq4-preview
开发者目前可以通过 Vidu 开放平台调用 Q4 Preview。
模型 ID 为:
viduq4-preview图生视频接口为:
POST /ent/v2/img2video参考生视频接口为:
POST /ent/v2/reference2video生成任务采用异步模式。
提交任务后,平台会返回任务 ID。
开发者再通过查询接口获取任务状态和最终结果。
这比较适合:
AI 视频平台;
短剧生产系统;
广告素材工具;
电商内容平台;
企业批量视频工作流。
提示词当前最多支持:
20000 个字符。
足够容纳比较完整的:
角色设定;
镜头要求;
动作顺序;
对白;
声音;
特效;
负面约束。
十四、首发宣传价 0.09 元/秒起,但不要直接套到所有规格
生数科技对外公布的首发优惠价格为:
0.09 元/秒起。
这里的关键词是:
“起”。
不同产品入口、分辨率和套餐,实际价格并不相同。
官方 API 当前采用积分计费。
在公开积分表中,不同分辨率每秒消耗分别为:
540P
9积分 / 秒
720P
19积分 / 秒
1080P
24积分 / 秒
2K
38积分 / 秒
4K
78积分 / 秒因此不能简单理解成:
所有 4K 视频都只需要 0.09 元一秒。
批量调用以前,应该在控制台确认:
当前积分单价;
生成模式;
分辨率;
时长;
活动折扣;
最终预估消耗。
十五、最适合哪些场景?
AI 短剧与漫剧
多张人物设定图和声音参考,可以帮助保持角色视觉与音色一致。
广告营销
同时提供商品、模特、服装、场景和品牌参考,生成不同创意版本。
电商视频
围绕真实商品图片,生成使用场景、模特展示和产品特写。
影视预演
提前测试演员动作、镜头、场景和视觉特效,降低正式制作前的试错成本。
虚拟角色
使用人物多角度设定和声音参考,生成更加统一的角色内容。
社交媒体内容
根据 9:16、3:4、1:1 等画幅,批量制作不同平台的短视频。
十六、Preview 版本目前还有哪些边界?
首先,它仍然是:
Preview。
后续正式版的能力、价格和接口可能继续调整。
其次,当前 API 主要支持:
图生视频;
参考生视频。
不应把 Vidu 平台其他模型或功能,默认算到 Q4 Preview 身上。
例如目前没有公开:
纯文生视频;
视频参考输入;
独立首尾帧模式;
视频编辑入口。
第三,4K 输出不代表所有细节都一定正确。
尤其需要检查:
小字号文字;
品牌 Logo;
商品结构;
人物手部;
复杂多人动作;
口型和对白;
长镜头中的身份一致性。
真正进入生产环境时,依然应该先建立:
短片测试;
素材规范;
验收标准;
人工质检;
失败重试
等完整流程。
结语
Vidu Q4 Preview 这次可以记住几个核心数字:
最多 15 张参考图片。
最多 3 段参考音频。
单次生成 3~16 秒。
最高 4K 输出。
支持 10-bit 色深。
提示词最多 20000 字符。
同时支持:
人物情绪表演。
动态运镜。
复杂动作。
爆炸、烟火、粒子和能量特效。
原生对白与音效。
但相比这些参数,更值得关注的是:
Vidu 正在把 AI 视频的控制方式,从一句简单 Prompt,继续扩展成:
人物长什么样
+
穿什么衣服
+
使用什么商品
+
站在什么场景
+
说话是什么声音
+
做什么动作
+
镜头怎么运动
+
特效如何出现以前 AI 视频更像是在抽一个结果。
现在则越来越接近:
给模型完整的演员、场景、声音和导演要求,再让它完成一段表演。
Q4 Preview 还不是最终的 Vidu Q4。
但它已经让我们看到,新一代视频模型竞争的重点,正在从:
“能不能生成视频”
继续走向:
“能不能真正把人物演好、把镜头讲清楚。”
相关链接
Vidu 官网
https://www.vidu.com/
Vidu 开放平台
https://platform.vidu.cn/
Vidu 模型地图
https://platform.vidu.cn/models
Vidu Q4 Preview 图生视频 API
https://platform.vidu.cn/docs/api-reference/video-models/vidu-q4-preview/image-to-video
Vidu Q4 Preview 参考生视频 API
https://platform.vidu.cn/docs/api-reference/video-models/vidu-q4-preview/reference-to-video
Vidu API 产品价格
https://platform.vidu.cn/pricing
Vidu API 价格文档
https://platform.vidu.cn/docs/pricing
Vidu API 更新记录
https://platform.vidu.com/docs/api-reference/updates
生数科技官网
https://www.shengshu.com/标签






评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。