
2026年7月31日,字节跳动Seed团队正式发布新一代视频创作模型 Seedance 2.5。
新模型将单次音视频生成时长从15秒提升至30秒,并重点升级长叙事、多模态参考和视频编辑能力。它既可以根据提示词生成连续的一镜到底镜头,也能在30秒内自动组织多个具有逻辑关联的镜头,让故事经历铺垫、推进、转折和收尾,而不是把一个简单动作机械延长。
Seedance 2.5目前正在陆续上线:
- 即梦AI网页端
- 豆包专业版
- 其他字节跳动相关创作平台
官方表示,API服务将在近期上线火山方舟。截至2026年7月31日,尚未公布正式API价格和完整接口文档。
Seedance 2.5是什么?
Seedance 2.5是字节跳动推出的新一代多模态音视频联合生成模型。
它延续Seedance 2.0的统一音视频生成架构,可以同时理解文字、图片、视频和音频参考,再直接生成包含画面、人物对白、环境声、音乐和动作音效的视频内容。
与Seedance 2.0相比,Seedance 2.5的重点不只是让视频变长,而是尝试完成一段更完整的创作:
- 单次生成时长从15秒提升至30秒
- 支持连续一镜到底
- 支持多镜头长叙事
- 支持多轮延长
- 参考素材数量大幅增加
- 支持多人形象和声音参考
- 支持时间戳级别的定向编辑
- 强化白模、绿幕和视角编辑
- 优化人物肤质、眼神、光影及动作质量
字节跳动将这次更新概括为,用户对视频模型的期待正在从“生成一个片段”转向“完成一段创作”。
Seedance 2.5核心规格
| 项目 | Seedance 2.5 |
|---|---|
| 单次生成时长 | 最长30秒 |
| 输出类型 | 原生音视频 |
| 长视频能力 | 支持多轮延长 |
| 图片参考 | 最多30张 |
| 视频参考 | 最多10段 |
| 音频参考 | 最多10段 |
| 参考素材理论合计 | 最多50项 |
| 叙事方式 | 一镜到底、多镜头叙事 |
| 编辑方式 | 时间戳、绿幕、视角、运镜及参考编辑 |
| 专业控制 | 白模、动作、空间、灯光及机位参考 |
| 当前入口 | 即梦AI、豆包专业版陆续开放 |
| API状态 | 火山方舟近期上线 |
以上规格来自字节跳动Seed团队发布公告和Seedance 2.5官方模型页面。不同平台的实际文件格式、素材时长、延长次数和开放范围,仍需以产品界面为准。
“30秒一镜到底”应该如何理解?
“一镜到底”是Seedance 2.5支持的一种生成方式,而不是所有视频的默认结构。
用户可以在提示词中明确要求:
- 一镜到底
- 手持稳定器跟拍
- 无剪辑
- 连续环绕运镜
- 从近景自然过渡至全景
- 通过遮挡完成空间切换
官方演示中,一段歌手登台视频从后台化妆间开始,人物与工作人员互动后穿过走廊,与舞者汇合并进入舞台,最后拉远至演唱会全景。整个过程通过连续摄影机运动完成,而不是把多个独立片段简单拼接。
另一段京剧演示则通过人物旋转、靠旗遮挡和水袖动作完成镜头转移,在保持霸王、虞姬和武生主体一致的同时,连续完成环绕、中景、动作场面和舞台全景。
不过,一镜到底对空间结构、人物运动和摄影机路径的要求很高。复杂多人互动、快速动作或大范围场景变化仍可能出现人物漂移、空间不连续和物理关系错误。
30秒也可以包含多个逻辑镜头
Seedance 2.5的另一项重点,是在单次30秒生成中组织多个相关镜头。
过去不少AI视频即使支持较长时长,也可能只是让人物持续走路、镜头不断推进,缺少真正的故事发展。
Seedance 2.5试图在30秒中建立更完整的叙事结构:
- 建立人物和场景
- 引入事件或目标
- 推进人物行动
- 出现转折或冲突
- 完成结果或情绪收尾
官方将其描述为让故事从“铺垫、推进、转折到收尾”逐步展开,而不是简单延续一个画面。
例如,一段短视频可以在30秒内完成:
- 主角进入咖啡馆
- 发现桌上的旧照片
- 回忆画面出现
- 另一名角色走入镜头
- 两人对视
- 镜头停留在照片上结束
这些镜头需要共享同一人物设定、空间关系、声音环境和故事逻辑。
从15秒提升至30秒意味着什么?
Seedance 2.0官方版本支持直接生成4至15秒音视频,最高支持9张图片、3段视频和3段音频作为多模态参考。Seedance 2.5将单次时长翻倍至30秒,并将各类参考数量分别扩展至30张图片、10段视频和10段音频。
| 对比项目 | Seedance 2.0 | Seedance 2.5 |
| 单次最长时长 | 15秒 | 30秒 |
| 图片参考 | 9张 | 30张 |
| 视频参考 | 3段 | 10段 |
| 音频参考 | 3段 | 10段 |
| 一镜到底 | 支持基础连续运镜 | 重点强化 |
| 长叙事 | 多镜头短片 | 30秒完整叙事 |
| 延长能力 | 支持延长 | 支持多轮延长 |
| 编辑控制 | 多模态编辑 | 时间戳及专业编辑强化 |
| 白模参考 | 能力较有限 | 重点增强 |
| 多人声音参考 | 支持 | 复杂群像进一步强化 |
30秒依然不足以直接生成完整短剧或广告长片,但它已经可以容纳一个较完整的短视频结构,例如:
- 商品问题与解决方案
- 一段完整人物表演
- 产品从开箱到使用
- 角色冲突与情绪转折
- 教学步骤演示
- 品牌短故事
- 电影预告片段
支持多轮延长,生成数分钟连续内容
Seedance 2.5支持在已有视频之后继续生成下一段内容。
用户可以要求模型延续:
- 主要人物
- 场景环境
- 视觉风格
- 叙事节奏
- 摄影机方向
- 人物声音
- 环境音效
- 背景音乐
官方模型页面写明,目前可在单次30秒生成后继续延长两次;正式发布文章则将其描述为支持多轮延长,并称用户可以制作数分钟、具有统一视听语言的连续内容。具体延长次数可能因即梦AI、豆包专业版及后续API版本不同而变化。
过去制作长AI视频时,创作者通常需要:
- 分别生成多个片段
- 手动寻找可以衔接的画面
- 在剪辑软件中拼接
- 修正人物、色彩和声音变化
- 使用转场掩盖不连续问题
多轮延长则尝试直接从上一段视频的结尾状态继续生成,减少重复准备角色和场景参考的操作。
延长时能够保持哪些内容?
字节跳动在官方演示中要求模型延续一段地铁场景,并明确保持人物主体、场景、视觉风格和音效一致。
续写内容包括:
- 小男孩抱着足球在车厢中奔跑
- 地铁到站后从车门冲出
- 男主角追到站台和街道
- 两人最终停下并完成情绪转折
官方表示,模型在延长过程中可以保持主要人物、环境和叙事节奏的一致性,同时维持音画同步。
不过,“保持一致”不代表完全没有变化。连续延长次数增加后,以下问题仍可能逐渐积累:
- 人物五官变化
- 服装细节漂移
- 场景布局改变
- 声音音色波动
- 光线和色彩偏移
- 故事节奏变慢
- 背景人物数量变化
重要商业项目仍需要逐段审核,并在必要时使用参考图片、音频或前一段关键帧重新约束。
单次最多输入50项多模态参考素材
Seedance 2.5支持单次输入:
- 最多30张图片
- 最多10段视频
- 最多10段音频
按数量相加,理论上最多可提供50项参考素材。
这些素材可以承担不同作用。
图片可以参考
- 人物外貌
- 服装造型
- 商品结构
- 场景空间
- 色彩和灯光
- 画面风格
- 道具细节
- 镜头构图
视频可以参考
- 人物动作
- 舞蹈和表演
- 摄影机运动
- 剪辑节奏
- 视觉特效
- 场景转换
- 人物走位
- 镜头语言
音频可以参考
- 人物音色
- 对白
- 歌声
- 音乐节奏
- 环境声音
- 动作音效
- 情绪与语速
用户可以通过自然语言指定每份素材的用途,例如:
人物形象参考图片1,服装参考图片2,动作参考视频1,摄影机运动参考视频2,声音参考音频1,场景和灯光参考图片3。
多人形象和声音一致性进一步提升
多人物视频一直是AI生成中的难点。
当画面中同时出现主角、配角、群演和不同声音时,模型容易出现:
- 人物脸部混淆
- 服装互换
- 角色位置变化
- 不同人物使用相同声音
- 对白归属错误
- 镜头切换后身份变化
Seedance 2.5增加参考素材上限后,可以为不同人物分别提供多张照片和声音参考。
官方演示使用多组素材分别约束:
- 演唱会场地
- 钢琴演奏者
- 小提琴与大提琴演奏者
- 主唱
- 乐团成员
- 合唱团
- 观众席
模型需要在一个30秒音乐会场景中同时维持多人形象、声音和空间关系。字节跳动表示,在多人同框和群像叙事场景中,Seedance 2.5能够同时还原多个人物的形象与声音,并保持各主体特征相对稳定。
不过,官方同时承认,复杂动作的物理合理性和多主体互动场景的稳定性仍有改进空间。
白模参考让复杂镜头更可控
Seedance 2.5强化了白模参考能力。
白模也可以理解为没有复杂纹理的3D预演模型。创作者可以提前在3D软件中确定:
- 空间结构
- 人物站位
- 动作路线
- 摄影机位置
- 运镜路径
- 景别变化
- 道具位置
- 光源方向
再让Seedance 2.5根据白模的空间结构,生成带有完整人物、材质、场景和光影的视频。
例如,一段奇幻飞行视频可以先使用白模安排:
- 从天空俯冲
- 与神兽并行飞行
- 潜入海洋
- 穿过时空裂缝
- 进入宇宙
- 回到卧室
然后再用参考图片规定角色设计、童话风格、材质和灯光。
这种方式可以减少纯文字提示词在复杂空间和镜头调度上的不确定性。
白模不仅控制动作,还控制光影
Seedance 2.5会尝试从白模中读取空间和光源关系,再生成符合场景的:
- 光源方向
- 色温
- 光照强度
- 阴影投射
- 物体反射
- 人物受光变化
官方称,这能让人物和物体在不同场景中的光影更接近真实物理关系。
对于广告、汽车、工业展示和影视预演而言,白模参考比只上传一张风格图片更容易控制镜头路径和物体位置。
时间戳编辑:指定某几秒发生什么
Seedance 2.5支持通过时间戳精确控制视频内容。
用户可以在提示词中写明:
0—5秒:人物从门外进入房间,镜头缓慢后退。
6—10秒:人物拿起桌上的产品,镜头切换至手部特写。
11—20秒:展示产品使用过程,镜头环绕主体。
21—30秒:人物面向镜头说出品牌口号,画面拉远结束。模型会尝试根据每个时间段安排:
- 故事情节
- 景别
- 摄影机运动
- 人物动作
- 节奏
- 声音
- 场景变化
生成完成后,用户还可以针对指定片段中的角色、动作、声音或剧情进行修改,同时尽量保持修改前后连贯。
可以只修改运镜,不改变人物和动作
视频编辑中,用户有时只希望更换镜头语言,而不希望重新生成角色和剧情。
Seedance 2.5支持使用提示词限定编辑范围,例如:
保持人物、动作和视觉风格不变,只调整摄影机运动。
官方案例将15秒视频拆成多个时间段,分别使用微型FPV、横向跟拍、俯视下降、手持特写和快速甩镜等镜头运动。模型需要改变运镜,同时保留原来的角色、动作和内容。
这对以下场景比较实用:
- 广告镜头改版
- 产品展示优化
- 影视预演
- 不同平台画幅适配
- 同一素材制作多个导演版本
绿幕编辑不只是简单换背景
Seedance 2.5强化了绿幕编辑能力。
传统抠像换背景只是将人物从原画面中分离,再放到新场景里,容易出现光线、风向和人物动作不匹配。
Seedance 2.5会尝试根据新环境重新渲染:
- 衣服飘动方向
- 头发状态
- 人物步态
- 光影变化
- 遮挡关系
- 环境互动
例如,将训练场上的运动员转移到更衣室和正式比赛场景时,模型不仅需要更换背景,也要同步调整人物受到的光照和周围环境。
这类能力适合广告素材重制、虚拟拍摄、短剧预演和商品场景替换,但复杂边缘、透明材质和快速动作仍需检查。
画质、音质和动作同步进一步优化
Seedance 2.5针对AI视频常见的“油腻感”进行了系统调整。
官方重点提到的优化项目包括:
- 物体材质
- 人物皮肤
- 人物眼神
- 光线和阴影
- 画面饱和度
- 人物运动
- 音画同步
- 镜头衔接
- 场景过渡
模型还减少了不受控制的字幕和背景音乐,避免画面中随机出现无意义文字,或在用户没有要求的情况下自动加入过强的音乐。
这些优化的目标,是让成片更接近实拍或经过后期制作的影视内容,而不是呈现过度光滑、饱和度过高的典型AI质感。
不过,目前字节跳动尚未公布第三方盲测、统一质量分数或具体的错误率下降数据,因此“影视级”主要是官方产品描述,仍需结合真实任务判断。
Seedance 2.5适合哪些创作场景?
AI短剧与剧情短片
30秒长叙事和多轮延长,可以容纳人物关系、事件发展和情绪转折。
广告视频
可以同时参考商品图、品牌风格、人物、动作、音乐和摄影机语言,生成相对完整的广告片段。
电商产品视频
适合制作产品开箱、使用演示、模特展示和场景化商品视频。
正式发布前必须核对商品结构、颜色、文字和功能是否与实物一致。
音乐与舞蹈视频
可参考人物音色、歌曲、舞蹈动作、舞台环境和运镜方式。
影视预演
导演和创意团队可以通过白模、分镜图和镜头参考,快速验证场面调度和摄影机路径。
教学视频
Seedance 2.5可以把历史事件、科学原理和实验流程转化为动态演示。字节跳动已经展示其在豆包爱学“豆包课堂”中的应用案例。
工业与制造
可以根据白模和产品图片制作装配动画、设备演示和流程培训视频。
机器人与自动驾驶数据
官方表示,Seedance 2.5也在探索生成机器人训练视频、工业仿真和极端天气交通场景等合成数据。
Seedance 2.5目前如何使用?
官方目前提供两个主要体验入口。
即梦AI
进入即梦AI网页端,在“视频生成”中选择Seedance 2.5。
即梦AI入口:
豆包专业版
进入豆包专业版的视频生成模块,选择Seedance 2.5。
豆包入口:
字节跳动表示,模型正在陆续上线,并不代表所有账户会在同一时间获得全部能力。
API什么时候开放?
官方宣布,Seedance 2.5 API将在近期上线火山方舟。
截至2026年7月31日,目前尚未公开:
- API模型ID
- 正式调用价格
- 支持的输出分辨率
- 单段参考视频时长限制
- 单段参考音频时长限制
- 文件大小上限
- 延长接口参数
- 并发限制
- 是否开放全部编辑能力
因此,第三方平台声称已经提供Seedance 2.5 API时,需要检查其是否属于官方接口、代理转发,或者只是使用相近名称的其他模型。
火山方舟入口:
https://www.volcengine.com/product/ark
“AI视频开始会讲故事了”是否准确?
Seedance此前已经具备多镜头生成能力,因此不能说过去的AI视频完全不会叙事。
Seedance 2.5真正推进的是:
- 单次可用叙事空间从15秒扩大到30秒
- 镜头之间具有更明确的逻辑关系
- 人物、场景和声音能够在多个镜头中延续
- 可以在已有故事后继续生成
- 用户可以按时间段指定剧情和镜头
- 参考素材足以覆盖更多角色和场景
- 生成后还能对局部剧情继续修改
因此,更准确的说法是:
Seedance 2.5让AI视频从生成一个精彩镜头,进一步走向组织一段完整叙事。
它距离自动生成稳定的长篇电影仍有明显距离,但在广告、短视频、短剧和影视预演中,已经能够承担更完整的创作环节。
当前仍有哪些限制?
复杂动作仍可能不符合物理规律
官方明确承认,复杂运动的物理合理性仍有改进空间。
多主体互动并非完全稳定
多人拥抱、打斗、交换物品和互相遮挡时,仍可能出现肢体或身份混淆。
多轮延长会积累误差
延长次数越多,人物、环境、声音和叙事节奏越容易偏离。
30秒不是完整长片
数分钟内容仍依赖多轮延长、镜头筛选和后期剪辑。
参考数量多不等于全部能被准确采用
一次输入大量图片、视频和音频后,不同参考之间可能存在冲突。用户需要明确指定每份素材的用途。
版权和肖像问题仍需关注
上传真人照片、声音、影视片段、音乐和品牌素材前,需要确认拥有相应授权。
API尚未开放
企业集成和批量生成仍需等待火山方舟正式接口与价格。
使用Seedance 2.5的提示词建议
30秒视频比5秒或10秒视频需要更清晰的结构。
建议在提示词中明确以下内容。
1. 先写整体目标
生成一段30秒的电影感产品广告,包含原生音效与背景音乐。2. 标注参考素材用途
人物参考@图片1,服装参考@图片2,商品参考@图片3,
运镜参考@视频1,音乐节奏参考@音频1。3. 按时间段安排故事
0—6秒:建立场景和人物。
7—15秒:展示人物发现产品。
16—24秒:演示产品核心功能。
25—30秒:品牌Logo和结束画面。4. 明确镜头方式
一镜到底、手持稳定器跟拍、无剪辑;
或使用近景、中景、产品特写和全景四个逻辑镜头。5. 写明不能改变的内容
保持人物五官、服装、商品结构、品牌颜色和声音一致,
不得生成额外字幕,不要改变Logo。6. 控制画面质感
自然肤质、低饱和电影色彩、真实光影,
避免过度磨皮和塑料质感。这种结构比只写一段情绪化描述,更容易让模型理解30秒视频中每个阶段需要完成什么。
总结
字节跳动Seedance 2.5于2026年7月31日正式发布。
模型将单次音视频生成时长从15秒提升至30秒,既可以完成连续一镜到底,也可以在30秒内组织多个逻辑关联镜头,让故事具备铺垫、推进、转折和收尾。
Seedance 2.5还支持多轮延长,并尝试在续写过程中保持人物主体、场景、视觉风格、叙事节奏和音效一致。官方称,用户可以通过连续延长生成数分钟、具有统一视听语言的视频内容。
多模态参考上限也大幅增加:
- 30张图片
- 10段视频
- 10段音频
模型可以分别参考人物、场景、道具、构图、动作、运镜、声音和音乐,并在多人同框与群像叙事中保持多个人物的形象和声音。
在编辑方面,Seedance 2.5支持时间戳控制、指定片段修改、绿幕编辑、视角编辑、运镜编辑、白模参考和创意参考,使其更接近影视和广告中的可控创作工具。
不过,复杂物理动作、多主体互动和连续延长的稳定性仍有提升空间,官方API价格、文件限制和完整接口也尚未公布。
Seedance 2.5最大的变化不是简单把视频从15秒延长到30秒,而是让模型开始同时处理:
谁在故事里、镜头如何移动、声音如何延续、事件怎样推进,以及用户生成后还想修改什么。
AI视频正在从“生成一段好看的片段”,走向“完成一段可以继续编辑和延展的创作”。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。