2026年7月20日,字节跳动Seed团队正式发布音频创作模型 Seed Audio 1.0。
与主要将文字转换成单一人声的传统语音合成模型不同,Seed Audio 1.0以完整的“声音场景”为生成单位,可以在一个统一框架中协调生成人物对白、环境声、关键音效和其他场景级音频元素。
用户只需通过一条Prompt描述人物、台词、情绪、说话节奏、声音环境及音效出现的时机,模型即可生成具有角色表演、空间氛围和叙事节奏的完整音频内容。字节跳动希望让音频生成从“分别制作多个声音片段再进行混音”,转向直接编排一个连贯的声音场景。
Seed Audio 1.0目前已通过BytePlus提供服务,国内开发者也可以通过火山引擎豆包语音的音频生成接口进行接入。

Seed Audio 1.0是什么?
Seed Audio 1.0是字节跳动面向影视、短剧、动画、游戏、广告、播客及内容创作场景推出的音频生成模型。
它并非只负责朗读文本,而是需要同时理解:
- 谁在说话
- 角色处于什么情绪
- 台词应该采用什么语气
- 什么时候开始说话
- 环境中存在哪些声音
- 音效应该在哪个时间点进入
- 不同声音之间如何保持合理的空间关系
- 整个场景应该呈现怎样的叙事节奏
例如,用户可以描述一段雨夜追逐场景,要求角色急促说出台词,同时加入脚步、雨水、远处车辆和警报等声音。Seed Audio 1.0会将这些元素放在同一个场景上下文中处理,而不是把对白和音效视为互不相关的生成任务。
从“生成一句话”转向“创作完整声音场景”
过去的AI语音工具通常将工作流程拆分成多个步骤:
- 生成角色对白
- 单独寻找或生成环境声
- 单独添加脚步、关门等音效
- 将不同素材导入音频编辑软件
- 调整每条音轨的入场时间
- 处理音量、空间感和混音关系
- 反复试听并修改
Seed Audio 1.0尝试将其中一部分流程放入模型内部。
用户可以在同一条提示中说明对白、表演方式、环境氛围和声音事件,模型再根据完整场景统一安排不同元素。
这种方式尤其适合时间短、镜头多、需要快速验证声音效果的内容,例如AI短剧、游戏剧情、广告样片和动画预演。
不过,端到端生成不等于完全不需要后期。面向正式影视、商业广告和大型游戏时,创作者仍可能需要调整音量、降噪、音乐、对白清晰度和最终混音。
支持100毫秒级对白时间控制
Seed Audio 1.0支持通过Prompt指定角色对白的出现时间,目前控制精度为 100毫秒间隔。
这意味着创作者可以要求某句台词在指定时间点进入,更好地匹配视频画面、人物口型或广告节奏。
例如,提示词可以包含类似要求:
- 角色A在第1.2秒开始说话
- 角色B停顿0.5秒后回答
- 第3秒进入急促对白
- 画面切换后立即开始旁白
- 结尾前保留一秒安静空间
这类时间控制适用于:
- 视频配音
- 影视对白替换
- 广告口播
- 动画角色对白
- 短剧配音
- 有声内容制作
- 游戏剧情语音
- 多角色播客
需要注意的是,官方资料明确表示,当前100毫秒级时间控制主要集中在 角色对白。未来版本才计划将更加精细的控制扩展至音效、环境声和音乐,因此不宜将现阶段描述为所有声音元素都已支持100毫秒精确编排。
一条Prompt生成对白、音效和环境声
Seed Audio 1.0允许用户在一条提示词中描述完整音频场景。
提示词可以同时包含:
- 角色身份
- 声音年龄和特点
- 台词内容
- 情绪和表演状态
- 说话速度
- 停顿和节奏
- 所处环境
- 背景声
- 关键音效
- 不同声音的出现顺序
- 整体叙事氛围
例如:
夜晚的地铁站,一名年轻女性压低声音说“他就在后面”,语气紧张而克制。远处传来列车进站声,随后出现逐渐接近的脚步声,广播声保持模糊,不要盖过对白。
模型需要同时理解人物表演、背景空间和事件进展,再生成具有统一声学环境的音频。
相比“先配音、再找音效、最后混音”,这种方式可以更快完成概念样片和声音预演。
音色可以通过文字或参考音频生成
Seed Audio 1.0支持通过文字描述创建声音,也可以使用经过授权的参考音频,或将两种方式结合,而不需要为每一个角色重新训练独立模型。
创作者可以描述:
- 年龄范围
- 声音高低
- 说话速度
- 声线质感
- 职业与人物气质
- 情绪表达方式
- 口音或语言
- 角色的叙事风格
例如:
“30岁左右的男性声音,低沉但不压迫,说话克制,像纪录片旁白,在紧张场景中保持冷静。”
模型会根据文字信息构建相应声音,并结合场景情绪调整语调、节奏和表演。
若使用参考声音,则必须确认拥有相应授权,不应擅自复刻真人、演员、主播或公众人物的声线。
同一角色可以呈现多种情绪
音色稳定并不意味着每一句话都使用相同语气。
一个角色可能需要在不同场景中表现:
- 平静叙述
- 紧张低语
- 愤怒争吵
- 悲伤停顿
- 兴奋欢呼
- 疲惫表达
- 戏剧化表演
Seed Audio 1.0将声音放在完整场景中训练和生成,因此在保持角色可识别音色的同时,也可以根据情绪、节奏和叙事目的改变演绎方式。
这对连续短剧、动画角色和游戏人物较为重要。
如果角色在每个场景中都以同样的语气说话,即使音色相同,也容易产生机械感。模型需要保持“这个人还是同一个人”,同时让表演随剧情发生变化。
单次最长生成两分钟,支持继续延展
Seed Audio 1.0单次可以生成最长约 两分钟音频,并支持在已有结果基础上继续延展。
长音频生成需要模型持续保持:
- 角色音色
- 说话风格
- 空间环境
- 情绪发展
- 台词节奏
- 声音之间的相对关系
两分钟已经能够覆盖许多短视频、短剧片段、游戏对话和广告内容。
对于更长的播客、有声书或连续剧情,创作者可以分段生成并继续延展,但仍需检查连接位置是否自然,以及前后音色、音量和环境声是否一致。
支持20余种语言
Seed Audio 1.0支持20余种语言的音频生成,官方列出的语言包括:
- 中文
- 英语
- 日语
- 韩语
- 西班牙语
- 印度尼西亚语
- 德语
- 法语
- 泰语
- 越南语
模型不仅需要准确读出文字,还需要根据不同语言的发音、语速、节奏和本地表达习惯调整声音表现。
同一个角色还可以跨语言保持相对稳定的音色和表演特点,为海外短剧、游戏本地化、全球广告和多语种播客提供统一的角色声音。
相比将一段中文声音简单转换成其他语言,跨语言音频创作还需要处理:
- 句子长短差异
- 停顿位置
- 重音习惯
- 情绪表达
- 口语节奏
- 画面时间限制
- 角色音色一致性
官方后续还计划探索可控多语种翻译,让创作者进一步管理翻译后的表达方式、时间和持续长度。
Seed Audio 1.0采用什么架构?
Seed Audio 1.0采用统一的音频生成框架,将语言层面的场景理解与声学层面的高保真生成连接起来。
其中:
- 语言模型负责理解人物、情绪、对白、时间和场景关系
- 基于扩散机制的声学生成器负责生成最终音频
- 高保真潜在空间用于保留音色、韵律、环境质感和声音细节
模型先将创作意图整理成场景级控制信息,再在声学空间中生成完整音频。
这种架构让对白、音效和环境声共享同一个场景上下文。
模型不仅要知道“应该生成脚步声”,还需要判断脚步距离角色多远、应该在台词之前还是之后出现,以及是否会影响对白的清晰度。
与传统TTS有什么区别?
TTS是Text to Speech,即文字转语音,主要目标是将指定文本转换成自然人声。
Seed Audio 1.0则更接近场景级音频创作模型。
| 对比方向 | 传统TTS | Seed Audio 1.0 |
|---|---|---|
| 主要输出 | 单一人声 | 对白、音效和环境声组成的场景 |
| 核心输入 | 文本和音色 | 人物、对白、情绪、时间及环境描述 |
| 时间控制 | 以语速和停顿为主 | 支持100毫秒级对白入场控制 |
| 环境声音 | 通常需要后期添加 | 可以与对白统一生成 |
| 角色表演 | 依赖情绪标签 | 结合完整场景和叙事意图 |
| 多角色内容 | 通常需要分别生成 | 可以在一个场景中协调多个角色 |
| 典型用途 | 播报、客服、朗读 | 短剧、动画、游戏、广告及播客 |
传统TTS仍适合低延迟播报、导航、客服和固定文本朗读。
Seed Audio 1.0更适合需要声音表演、叙事氛围和多个音频元素协同的创作任务。
Seed Audio 1.0适合哪些场景?
AI短剧与影视配音
创作者可以根据剧本直接生成多角色对白、环境声和关键音效,用于样片、预演或正式制作素材。
100毫秒级对白时间控制也有助于声音与画面剪辑点对齐。
动画和漫画视频
不同角色可以拥有固定音色,并根据剧情表现开心、紧张、愤怒和悲伤等情绪。
游戏内容
可用于NPC对白、剧情演出、环境音和任务提示等内容,并支持多语种版本。
广告制作
广告通常对时长和台词入场时间要求较高。创作者可以指定角色表达方式和对白节奏,再根据成片长度进行调整。
播客与有声内容
模型可以生成多角色对话、旁白和场景氛围,适用于故事播客、有声小说和知识节目样片。
视频本地化
同一角色可以转换为不同语言,并尽量保留声音特点和表演方式,降低多地区版本重新制作的成本。
直播与电商内容
可以用于商品讲解、场景演绎和广告音频制作,但涉及商品价格、功效或承诺时仍需人工核对内容。
官方评测表现如何?
字节跳动从文本生成音色、多场景音频创作和多语种生成三个方向对Seed Audio 1.0进行了评估。
官方披露:
- 在影视、短剧、动画、播客、直播及语音合成等多数测试场景中,可用音频比例超过90%
- 多数受测语言的自然度MOS评分超过4.0
- 在复杂音频生成的指令遵循测试中,除越南语外,其他受测语言评分均超过3.5
这些数据来自字节跳动内部或官方组织的主观评测,主要用于说明模型在不同创作任务中的表现。
由于测试集、评审人员和竞品配置未完整公开,实际效果仍需结合具体语言、角色和场景进行验证。
火山引擎与BytePlus已经提供API
Seed Audio 1.0已经进入字节跳动的云服务体系。
海外开发者可以通过BytePlus Seed Speech中的Audio 1.0服务接入。官方文档显示,该服务提供基于HTTP的非流式音频生成接口,并支持上传多个参考音频或图片作为生成条件。
国内开发者可以通过火山引擎豆包语音的音频生成HTTP接口进行接入,目前该接口对应的模型为:
seed-audio-1.0
火山引擎文档同样显示,接口支持上传多个参考音频或图片,适用于有声书、配音和游戏等场景。
在接入正式业务前,开发团队还需要关注:
- API计费方式
- 单次生成时长
- 文件格式
- 音频采样率
- 并发限制
- 参考素材大小
- 任务处理时间
- 音频存储和下载方式
- 内容审核规则
- 声音授权要求
具体参数和价格应以火山引擎或BytePlus最新控制台为准。
多参考音频与图片有什么作用?
API支持使用多个参考音频或图片,可以为模型提供更完整的创作条件。
参考音频可以用于说明:
- 角色音色
- 说话风格
- 情绪状态
- 环境质感
- 背景声特点
参考图片则可以帮助模型理解:
- 场景空间
- 人物数量
- 时代背景
- 视觉氛围
- 可能出现的声音事件
例如,上传一张繁忙夜市图片,再描述人物对白和剧情,模型可以据此生成更加符合场景的环境音。
不过,图片只能作为生成参考,无法保证模型准确还原画面中每一个声音来源。
当前还存在哪些限制?
精细时间控制主要针对对白
目前100毫秒精度主要用于角色对白,尚未全面覆盖音乐、环境声和所有音效。
长场景仍可能出现一致性问题
虽然模型支持两分钟生成和继续延展,但场景越长、角色越多,音色、空间和叙事节奏的控制难度越高。
正式项目仍需要混音
模型可以生成完整场景,但商业影视和游戏通常仍需进行对白分离、响度调整、降噪和母带处理。
参考声音需要合法授权
未经同意复刻真实人物声音,可能涉及肖像、人格、隐私和商业权益问题。
多语种效果可能存在差异
官方评测显示不同语言之间的自然度和指令遵循表现并不完全一致,目标市场上线前仍需由母语使用者检查。
生成内容可能出现错误
模型可能生成与场景不符的声音、不准确发音或节奏问题,不能直接跳过人工审核。
字节跳动的AI音频布局
Seed Audio 1.0并不是字节跳动在语音和音频领域的第一个模型。
Seed团队此前已经推出或研究:
- Seed-TTS语音合成模型
- Seed-ASR语音识别模型
- Seed-Music音乐生成系统
- Seedance音视频联合生成模型
- 豆包语音合成和声音复刻服务
Seed-TTS侧重高质量人声与音色学习,Seed-ASR负责识别多语言、方言和复杂语音,Seed-Music面向音乐创作,Seedance则负责视频与声音联合生成。
Seed Audio 1.0进一步将语音、音效和环境声整合到完整声音场景中,补充了独立音频创作环节。
AI音频工具会如何改变内容生产?
过去,一段完整音频通常需要配音演员、录音师、音效师和混音师共同完成。
Seed Audio 1.0可以降低早期创作和样片制作的门槛,让创作者快速验证:
- 角色声音是否合适
- 场景氛围是否成立
- 台词节奏是否匹配画面
- 音效应该在哪里出现
- 多语种版本是否可行
但对于精品内容,人工专业能力仍然重要。
AI可以帮助生成草稿、补充素材和减少重复操作,创作者仍需负责表演指导、声音设计、版权、文化表达及最终质量。
后续将增加哪些能力?
字节跳动已经公布Seed Audio后续计划,包括:
- 将精细时间控制扩展至音效、环境声和音乐
- 提高更长、更复杂场景中的音色一致性
- 支持视频参考输入
- 增强长篇音频生成
- 探索多轨音频生成
- 支持可控多语种翻译
- 加强跨语言时间与时长管理
其中,多轨生成值得关注。
当前端到端音频通常直接输出混合后的完整结果,如果未来能够分别输出对白、音效、环境声和音乐轨道,专业用户就可以在剪辑软件中进行更细致的调整。
总结
Seed Audio 1.0是字节跳动Seed团队推出的场景级音频创作模型。
它可以在统一框架中生成角色对白、音效、环境声及其他音频元素,并结合人物、情绪、时间和空间信息形成完整声音场景。
模型当前支持100毫秒级角色对白时间控制、通过文字或授权参考音频创建音色、单次最长约两分钟生成及继续延展,并覆盖20余种语言。
Seed Audio 1.0已经通过BytePlus和火山引擎提供音频生成服务,开发者可通过HTTP接口调用seed-audio-1.0模型。
这次发布的核心并不只是让AI语音听起来更加自然,而是让模型开始理解一个声音场景应该如何组织:谁先说话、声音来自哪里、情绪如何变化,以及音效怎样服务叙事。
不过,当前的精细时间控制仍主要面向对白,长场景一致性、多轨编辑和复杂声音元素控制还需要继续完善。对于正式影视、广告和游戏内容,人工审核与专业混音依然不可缺少。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。