可灵 Kling 4.0 官宣:8000 Token、30 秒原生视频,立体声和口型一起做
Kling 4.0。
9 月 28 日,可灵正式公布 Kling 4.0 系列。

其中:
Kling 4.0 Flash 已经率先开放小范围体验。
而能力更完整的 Kling 4.0 以及 API,将在:
2026 年 10 月正式上线。
这一代最明显的变化,并不是简单把视频做得更清晰。
而是同时补齐:
时长。
参考控制。
关键帧。
音频。
唇形同步。
多语言表达。
视频编辑。
以及:
更完整的创作工作流。
如果把过去的 AI 视频理解成:
生成一个短镜头。
那么 Kling 4.0 想进一步解决的是:
如何按照导演的要求,完成一段有角色、有声音、有节奏的完整场景。
一、Kling 4.0 Flash 已经开放,完整版 10 月上线
这次发布采用了分阶段开放的方式。
目前率先进入小范围体验的是:
Kling 4.0 Flash。
首批面向黑金年卡,也就是 Ultra Yearly 用户开放。
Flash 版本主要针对:
高频创作;
快速试错;
批量生成;
成本敏感场景。
完整的 Kling 4.0 则计划于 10 月正式上线,API 也会在同一阶段逐步开放。
因此,当前能够体验到的 Flash 功能,并不一定等于 10 月完整版的全部能力。
尤其是:
4K;
10-bit HDR;
最长 2 分钟续拍
等能力,目前仍应以正式上线后的产品页面为准。
二、原生视频时长直接拉到 30 秒
Kling 4.0 支持单次原生生成最长:
30 秒视频。
相比过去以 5 秒、10 秒或 15 秒为主的生成方式,30 秒已经足以承载一段相对完整的内容。
例如一条产品广告可以直接完成:
0—5秒
建立场景和氛围
5—12秒
人物或产品登场
12—22秒
展示核心动作与卖点
22—27秒
进入情绪高潮
27—30秒
品牌Logo与结尾信息这意味着创作者不一定要再把一条 30 秒广告拆成六个独立片段,然后自己处理:
人物一致性;
声音衔接;
镜头过渡;
画面色调;
动作连续性。
生成单位正在从:
单个镜头
逐渐扩大到:
完整场景。
三、最多 10 张关键帧,开始真正控制叙事节点
只有时长变长还不够。
如果 30 秒里发生什么仍然完全由模型决定,创作者依然很难控制最终结果。
Kling 4.0 因此加入了:
多关键帧控制。
单次最多可以输入:
10 张关键帧。
创作者可以提前指定:
人物什么时候出现;
角色什么时候转身;
场景什么时候变化;
产品什么时候进入特写;
最后一个镜头停在哪里。
模型再负责补齐关键帧之间的:
人物动作;
物体运动;
镜头过渡;
场景变化。
整个过程更接近:
第1张关键帧
→ 建立场景
第3张关键帧
→ 人物登场
第6张关键帧
→ 产品特写
第8张关键帧
→ 情绪高潮
第10张关键帧
→ 最终落版相比只给首帧和尾帧,10 个关键节点已经可以对一段视频的叙事结构进行更细致的控制。
四、最多组合 15 项多模态参考
Kling 4.0 进一步加强了:
Omni Reference,全能参考。
单次生成最多可以组合:
15 项多模态参考素材。
其中包括:
最多 10 张图片;
最多 5 段视频;
最多指定 7 个主体。
需要注意,这里的 7 个主体属于生成任务中的主体控制数量,并不是在 15 项素材之外额外增加 7 项输入。
这些参考素材可以分别承担不同作用。
例如:
图片1
→ 主角外观
图片2
→ 服装
图片3
→ 产品
视频1
→ 人物动作
视频2
→ 镜头运动
音频
→ 人物声音
文字
→ 剧情、场景和节奏模型需要将这些输入统一理解,再生成风格、人物和叙事相对一致的新视频。
对商业内容来说,这项能力可能比单纯提高分辨率更加重要。
因为广告和影视项目很少完全从零生成。
更多时候都需要基于已有的:
演员形象;
商品资产;
品牌视觉;
动作参考;
导演样片
继续创作。
五、提示词上限提升到 8000 Token
Kling 4.0 还把提示词输入上限提高到:
8000 Token。
这里的 Token 并不等于固定数量的汉字或单词,实际长度会受到语言和分词方式影响。
但 8000 Token 已经足够容纳非常完整的视频需求。
例如可以在同一条提示词中写清楚:
角色设定;
场景信息;
镜头顺序;
人物对白;
动作细节;
光影变化;
音乐氛围;
画面风格;
运镜要求;
哪些元素必须保留;
哪些内容不能出现。
以前一个视频 Prompt 可能只有:
一个女孩走进咖啡馆,电影感。
现在可以进一步写成接近:
导演脚本 + 分镜说明 + 表演要求 + 摄影指导。
Kling 4.0 还会对输入内容进行适度补充、扩写和整理,帮助模型理解更复杂的创作意图。
不过提示词并不是越长越好。
真正有效的 8000 Token,应该用于补充:
明确约束;
镜头逻辑;
角色关系;
时间顺序。
如果只是大量重复形容词,反而可能增加模型理解负担。
六、音频升级到双通道立体声
Kling 4.0 继续加强了原生音视频生成能力。
新版本支持:
高品质音频。
双通道立体声。
这意味着模型不再只是生成一条简单的单声道背景声音。
它可以进一步表现声音的:
左右位置;
空间距离;
运动方向;
环境层次。
例如一辆汽车从画面左侧驶向右侧时,声音也可以随位置变化。
角色位于镜头左边讲话时,人声可以拥有更加合理的空间方向。
在森林、街道、酒吧或演唱会等复杂场景中,环境音也可以拥有更明显的层次。
对于戴耳机观看的用户来说,立体声能够明显提升画面的空间感和沉浸感。
七、唇形同步和表演开始一起生成
人物对话一直是 AI 视频最容易暴露问题的环节。
常见问题包括:
嘴型和声音对不上;
句子结束了,人物嘴巴还在动;
多人对话时角色说错台词;
表情和语气没有关系;
画面切换后声音突然变化。
Kling 4.0 对角色口型匹配进行了进一步优化。
目标不只是让嘴巴跟着音频开合,而是让:
声音。
对白。
口型。
表情。
人物动作。
尽量保持同步。
例如人物语气愤怒时,模型还需要同时处理:
面部表情;
身体动作;
说话节奏;
声音强弱。
这对:
AI 短剧;
数字人;
UGC 广告;
多人对话;
虚拟角色
都会更加实用。
八、支持多语言、口音和方言
Kling 4.0 进一步扩展了语言能力。
目前公布的支持范围包括:
中文;
英语;
日语;
韩语;
西班牙语;
葡萄牙语;
德语;
法语;
印地语
等语言。
同时还支持多种口音与方言,例如:
粤语;
东北话;
四川话;
北京口音;
美式英语;
英式英语;
印度英语。
这意味着同一个角色可以在不同市场中使用对应语言和口音生成视频。
例如一条商品广告可以分别输出:
中文版本;
英文版本;
西班牙语版本。
并尽量保持:
角色外观;
镜头结构;
人物动作;
品牌视觉
一致。
此外,新版本还加强了多语言文字、Emoji 和 Logo 的画面生成能力。
不过商业项目中的品牌文字和 Logo,正式投放前依然需要人工逐帧检查。
九、支持 4K、10-bit HDR 和 21:9 超宽画幅
Kling 4.0 的完整规格计划支持:
720P。
1080P。
4K。
其中 1080P 和 4K 还将支持:
10-bit HDR。
相比普通 8-bit 视频,10-bit 能够表现更丰富的色彩层次,尤其适合:
天空渐变;
霓虹灯;
逆光;
夜景;
烟雾;
复杂光影。
理论上可以减少:
色彩断层;
高光爆白;
夜景糊成一片;
霓虹边缘溢色
等问题。
此外,Kling 4.0 还加入:
21:9 超宽画幅。
这类画幅更接近电影宽银幕比例,适合:
电影预告;
品牌大片;
汽车广告;
横屏大屏展示;
沉浸式场景。
需要注意,4K 和 10-bit HDR 当前仍属于后续开放能力,不代表所有 Flash 体验用户现在都能直接使用。
十、从生成视频,继续走向精准编辑
Kling 4.0 不只是生成模型。
它还加强了对已有视频的编辑能力。
用户可以同时提供:
文字;
图片;
人物主体;
原始视频。
再要求模型对视频中的内容进行:
增加;
删除;
替换;
修改。
例如:
保留人物动作和镜头,只把服装换成黑色西装。
删除桌面上的水杯,其他内容保持不变。
把晴天改成雨夜,保留原本的建筑和人物。
将普通街道替换成未来城市。
除了主体和背景,还可以进一步调整:
风格;
天气;
颜色;
材质;
景别;
观察视角。
这让 AI 视频的工作方式从:
一次生成,不满意重抽
逐渐转向:
先生成,再持续修改。
十一、参考视频可以直接提供“导演语言”
Kling 4.0 还强化了:
创意复刻。
模型可以分析参考视频中的:
镜头运动;
画面节奏;
构图方式;
转场结构;
人物调度;
叙事逻辑。
然后基于新的角色、产品和场景,重新生成一条内容不同、但镜头语言相近的视频。
例如品牌给出一段汽车广告作为参考。
模型可以提取其中的:
低机位跟拍;
快速转场;
车身特写;
城市夜景;
最后定格 Logo。
再将同样的叙事结构应用到另一个产品上。
这并不意味着可以无边界复制现有商业作品。
使用第三方视频作为参考时,仍然需要注意:
版权;
角色形象;
品牌标识;
声音授权;
商业使用范围。
十二、多次续拍最长可延展到 2 分钟
除了原生 30 秒生成,Kling 4.0 还公布了:
多次续拍。
通过连续延长视频,最长可以扩展至:
约 2 分钟。
这意味着创作者可以先生成 30 秒主体内容,再围绕已有视频继续:
延长剧情;
补充结尾;
增加新镜头;
扩大场景。
不过多次续拍目前同样标注为:
即将上线。
而且视频越长,角色一致性、空间关系和声音连续性越难维持。
所以 2 分钟更适合理解成可达到的产品上限,而不是每条视频都能稳定保持 2 分钟电影级一致性。
十三、创作页面也开始变成“导演工作台”
可灵这次不只更新了模型。
创作界面也进行了重新整理。
图片、视频和音频参考素材,可以放进同一个输入区域自由组合。
生成结果支持:
宫格视图;
列表视图。
预览、剪辑和添加素材,可以在同一条时间线上完成。
同时,画布 Agent 可以帮助用户:
整理素材;
分析创意需求;
生成脚本;
制作分镜;
继续调整结果。
整个流程逐渐变成:
创意想法
↓
Agent整理需求
↓
脚本与分镜
↓
上传图片、视频和声音参考
↓
生成多个版本
↓
时间线预览和编辑
↓
继续修改与续拍
↓
完成成片可灵想做的,已经不只是一个视频生成页面。
而是一套从构思到成片的 AI 影像工作台。
十四、Flash 和完整版怎么选?
Kling 4.0 Flash
更加适合:
高频生成;
快速试错;
社交媒体内容;
UGC 广告;
批量方案探索;
成本敏感任务。
目前已经向黑金年卡用户开放小范围体验。
Kling 4.0 完整版
更适合:
复杂叙事;
长镜头;
多参考素材;
更高画质;
专业音视频;
影视和商业制作。
预计于 10 月上线。
API 同样计划在 10 月开放。
不过官方尚未完整公布:
具体价格;
API 模型名称;
不同分辨率消耗;
各套餐开放范围。
开发者和企业仍需等待正式 API 文档。
结语
Kling 4.0 这次可以记住几个核心数字:
最长 30 秒原生视频。
最多 10 张关键帧。
最多 15 项多模态参考。
最多 10 张图片。
最多 5 段参考视频。
最多 7 个主体。
8000 Token 提示词。
双通道立体声。
多语言与多种口音。
以及后续将开放的:
4K。
10-bit HDR。
最长 2 分钟续拍。
相比单纯提升画面清晰度,这一代更明显的方向是:
让创作者说得更清楚,也让模型执行得更完整。
从人物长什么样,到应该穿什么衣服。
从镜头怎么运动,到第几秒发生什么。
从角色说哪种语言,到声音来自画面的哪个方向。
越来越多过去只能靠后期制作解决的问题,正在进入同一个视频模型。
Kling 4.0 Flash 已经开始小范围体验。
真正完整的 Kling 4.0,则将在 10 月正式登场。
相关链接
Kling 4.0 官方发布说明
https://kling.ai/release-note/release-notes/Kling_4
Kling AI 官网
https://kling.ai/
Kling AI 开发者平台
https://kling.ai/dev
Kling AI API 文档
https://kling.ai/document-api/quickStart/productIntroduction/overview
Kling AI 官方使用指南
https://kling.ai/quickstart





评论 0
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。