2026年7月20日,字节跳动Seed团队正式发布音频创作模型 Seed Audio 1.0

与主要将文字转换成单一人声的传统语音合成模型不同,Seed Audio 1.0以完整的“声音场景”为生成单位,可以在一个统一框架中协调生成人物对白、环境声、关键音效和其他场景级音频元素。

用户只需通过一条Prompt描述人物、台词、情绪、说话节奏、声音环境及音效出现的时机,模型即可生成具有角色表演、空间氛围和叙事节奏的完整音频内容。字节跳动希望让音频生成从“分别制作多个声音片段再进行混音”,转向直接编排一个连贯的声音场景。

Seed Audio 1.0目前已通过BytePlus提供服务,国内开发者也可以通过火山引擎豆包语音的音频生成接口进行接入。

image.png

Seed Audio 1.0是什么?

Seed Audio 1.0是字节跳动面向影视、短剧、动画、游戏、广告、播客及内容创作场景推出的音频生成模型。

它并非只负责朗读文本,而是需要同时理解:

  • 谁在说话
  • 角色处于什么情绪
  • 台词应该采用什么语气
  • 什么时候开始说话
  • 环境中存在哪些声音
  • 音效应该在哪个时间点进入
  • 不同声音之间如何保持合理的空间关系
  • 整个场景应该呈现怎样的叙事节奏

例如,用户可以描述一段雨夜追逐场景,要求角色急促说出台词,同时加入脚步、雨水、远处车辆和警报等声音。Seed Audio 1.0会将这些元素放在同一个场景上下文中处理,而不是把对白和音效视为互不相关的生成任务。

从“生成一句话”转向“创作完整声音场景”

过去的AI语音工具通常将工作流程拆分成多个步骤:

  1. 生成角色对白
  2. 单独寻找或生成环境声
  3. 单独添加脚步、关门等音效
  4. 将不同素材导入音频编辑软件
  5. 调整每条音轨的入场时间
  6. 处理音量、空间感和混音关系
  7. 反复试听并修改

Seed Audio 1.0尝试将其中一部分流程放入模型内部。

用户可以在同一条提示中说明对白、表演方式、环境氛围和声音事件,模型再根据完整场景统一安排不同元素。

这种方式尤其适合时间短、镜头多、需要快速验证声音效果的内容,例如AI短剧、游戏剧情、广告样片和动画预演。

不过,端到端生成不等于完全不需要后期。面向正式影视、商业广告和大型游戏时,创作者仍可能需要调整音量、降噪、音乐、对白清晰度和最终混音。

支持100毫秒级对白时间控制

Seed Audio 1.0支持通过Prompt指定角色对白的出现时间,目前控制精度为 100毫秒间隔

这意味着创作者可以要求某句台词在指定时间点进入,更好地匹配视频画面、人物口型或广告节奏。

例如,提示词可以包含类似要求:

  • 角色A在第1.2秒开始说话
  • 角色B停顿0.5秒后回答
  • 第3秒进入急促对白
  • 画面切换后立即开始旁白
  • 结尾前保留一秒安静空间

这类时间控制适用于:

  • 视频配音
  • 影视对白替换
  • 广告口播
  • 动画角色对白
  • 短剧配音
  • 有声内容制作
  • 游戏剧情语音
  • 多角色播客

需要注意的是,官方资料明确表示,当前100毫秒级时间控制主要集中在 角色对白。未来版本才计划将更加精细的控制扩展至音效、环境声和音乐,因此不宜将现阶段描述为所有声音元素都已支持100毫秒精确编排。

一条Prompt生成对白、音效和环境声

Seed Audio 1.0允许用户在一条提示词中描述完整音频场景。

提示词可以同时包含:

  • 角色身份
  • 声音年龄和特点
  • 台词内容
  • 情绪和表演状态
  • 说话速度
  • 停顿和节奏
  • 所处环境
  • 背景声
  • 关键音效
  • 不同声音的出现顺序
  • 整体叙事氛围

例如:

夜晚的地铁站,一名年轻女性压低声音说“他就在后面”,语气紧张而克制。远处传来列车进站声,随后出现逐渐接近的脚步声,广播声保持模糊,不要盖过对白。

模型需要同时理解人物表演、背景空间和事件进展,再生成具有统一声学环境的音频。

相比“先配音、再找音效、最后混音”,这种方式可以更快完成概念样片和声音预演。

音色可以通过文字或参考音频生成

Seed Audio 1.0支持通过文字描述创建声音,也可以使用经过授权的参考音频,或将两种方式结合,而不需要为每一个角色重新训练独立模型。

创作者可以描述:

  • 年龄范围
  • 声音高低
  • 说话速度
  • 声线质感
  • 职业与人物气质
  • 情绪表达方式
  • 口音或语言
  • 角色的叙事风格

例如:

“30岁左右的男性声音,低沉但不压迫,说话克制,像纪录片旁白,在紧张场景中保持冷静。”

模型会根据文字信息构建相应声音,并结合场景情绪调整语调、节奏和表演。

若使用参考声音,则必须确认拥有相应授权,不应擅自复刻真人、演员、主播或公众人物的声线。

同一角色可以呈现多种情绪

音色稳定并不意味着每一句话都使用相同语气。

一个角色可能需要在不同场景中表现:

  • 平静叙述
  • 紧张低语
  • 愤怒争吵
  • 悲伤停顿
  • 兴奋欢呼
  • 疲惫表达
  • 戏剧化表演

Seed Audio 1.0将声音放在完整场景中训练和生成,因此在保持角色可识别音色的同时,也可以根据情绪、节奏和叙事目的改变演绎方式。

这对连续短剧、动画角色和游戏人物较为重要。

如果角色在每个场景中都以同样的语气说话,即使音色相同,也容易产生机械感。模型需要保持“这个人还是同一个人”,同时让表演随剧情发生变化。

单次最长生成两分钟,支持继续延展

Seed Audio 1.0单次可以生成最长约 两分钟音频,并支持在已有结果基础上继续延展。

长音频生成需要模型持续保持:

  • 角色音色
  • 说话风格
  • 空间环境
  • 情绪发展
  • 台词节奏
  • 声音之间的相对关系

两分钟已经能够覆盖许多短视频、短剧片段、游戏对话和广告内容。

对于更长的播客、有声书或连续剧情,创作者可以分段生成并继续延展,但仍需检查连接位置是否自然,以及前后音色、音量和环境声是否一致。

支持20余种语言

Seed Audio 1.0支持20余种语言的音频生成,官方列出的语言包括:

  • 中文
  • 英语
  • 日语
  • 韩语
  • 西班牙语
  • 印度尼西亚语
  • 德语
  • 法语
  • 泰语
  • 越南语

模型不仅需要准确读出文字,还需要根据不同语言的发音、语速、节奏和本地表达习惯调整声音表现。

同一个角色还可以跨语言保持相对稳定的音色和表演特点,为海外短剧、游戏本地化、全球广告和多语种播客提供统一的角色声音。

相比将一段中文声音简单转换成其他语言,跨语言音频创作还需要处理:

  • 句子长短差异
  • 停顿位置
  • 重音习惯
  • 情绪表达
  • 口语节奏
  • 画面时间限制
  • 角色音色一致性

官方后续还计划探索可控多语种翻译,让创作者进一步管理翻译后的表达方式、时间和持续长度。

Seed Audio 1.0采用什么架构?

Seed Audio 1.0采用统一的音频生成框架,将语言层面的场景理解与声学层面的高保真生成连接起来。

其中:

  • 语言模型负责理解人物、情绪、对白、时间和场景关系
  • 基于扩散机制的声学生成器负责生成最终音频
  • 高保真潜在空间用于保留音色、韵律、环境质感和声音细节

模型先将创作意图整理成场景级控制信息,再在声学空间中生成完整音频。

这种架构让对白、音效和环境声共享同一个场景上下文。

模型不仅要知道“应该生成脚步声”,还需要判断脚步距离角色多远、应该在台词之前还是之后出现,以及是否会影响对白的清晰度。

与传统TTS有什么区别?

TTS是Text to Speech,即文字转语音,主要目标是将指定文本转换成自然人声。

Seed Audio 1.0则更接近场景级音频创作模型。

对比方向传统TTSSeed Audio 1.0
主要输出单一人声对白、音效和环境声组成的场景
核心输入文本和音色人物、对白、情绪、时间及环境描述
时间控制以语速和停顿为主支持100毫秒级对白入场控制
环境声音通常需要后期添加可以与对白统一生成
角色表演依赖情绪标签结合完整场景和叙事意图
多角色内容通常需要分别生成可以在一个场景中协调多个角色
典型用途播报、客服、朗读短剧、动画、游戏、广告及播客

传统TTS仍适合低延迟播报、导航、客服和固定文本朗读。

Seed Audio 1.0更适合需要声音表演、叙事氛围和多个音频元素协同的创作任务。

Seed Audio 1.0适合哪些场景?

AI短剧与影视配音

创作者可以根据剧本直接生成多角色对白、环境声和关键音效,用于样片、预演或正式制作素材。

100毫秒级对白时间控制也有助于声音与画面剪辑点对齐。

动画和漫画视频

不同角色可以拥有固定音色,并根据剧情表现开心、紧张、愤怒和悲伤等情绪。

游戏内容

可用于NPC对白、剧情演出、环境音和任务提示等内容,并支持多语种版本。

广告制作

广告通常对时长和台词入场时间要求较高。创作者可以指定角色表达方式和对白节奏,再根据成片长度进行调整。

播客与有声内容

模型可以生成多角色对话、旁白和场景氛围,适用于故事播客、有声小说和知识节目样片。

视频本地化

同一角色可以转换为不同语言,并尽量保留声音特点和表演方式,降低多地区版本重新制作的成本。

直播与电商内容

可以用于商品讲解、场景演绎和广告音频制作,但涉及商品价格、功效或承诺时仍需人工核对内容。

官方评测表现如何?

字节跳动从文本生成音色、多场景音频创作和多语种生成三个方向对Seed Audio 1.0进行了评估。

官方披露:

  • 在影视、短剧、动画、播客、直播及语音合成等多数测试场景中,可用音频比例超过90%
  • 多数受测语言的自然度MOS评分超过4.0
  • 在复杂音频生成的指令遵循测试中,除越南语外,其他受测语言评分均超过3.5

这些数据来自字节跳动内部或官方组织的主观评测,主要用于说明模型在不同创作任务中的表现。

由于测试集、评审人员和竞品配置未完整公开,实际效果仍需结合具体语言、角色和场景进行验证。

火山引擎与BytePlus已经提供API

Seed Audio 1.0已经进入字节跳动的云服务体系。

海外开发者可以通过BytePlus Seed Speech中的Audio 1.0服务接入。官方文档显示,该服务提供基于HTTP的非流式音频生成接口,并支持上传多个参考音频或图片作为生成条件。

国内开发者可以通过火山引擎豆包语音的音频生成HTTP接口进行接入,目前该接口对应的模型为:

seed-audio-1.0

火山引擎文档同样显示,接口支持上传多个参考音频或图片,适用于有声书、配音和游戏等场景。

在接入正式业务前,开发团队还需要关注:

  • API计费方式
  • 单次生成时长
  • 文件格式
  • 音频采样率
  • 并发限制
  • 参考素材大小
  • 任务处理时间
  • 音频存储和下载方式
  • 内容审核规则
  • 声音授权要求

具体参数和价格应以火山引擎或BytePlus最新控制台为准。

多参考音频与图片有什么作用?

API支持使用多个参考音频或图片,可以为模型提供更完整的创作条件。

参考音频可以用于说明:

  • 角色音色
  • 说话风格
  • 情绪状态
  • 环境质感
  • 背景声特点

参考图片则可以帮助模型理解:

  • 场景空间
  • 人物数量
  • 时代背景
  • 视觉氛围
  • 可能出现的声音事件

例如,上传一张繁忙夜市图片,再描述人物对白和剧情,模型可以据此生成更加符合场景的环境音。

不过,图片只能作为生成参考,无法保证模型准确还原画面中每一个声音来源。

当前还存在哪些限制?

精细时间控制主要针对对白

目前100毫秒精度主要用于角色对白,尚未全面覆盖音乐、环境声和所有音效。

长场景仍可能出现一致性问题

虽然模型支持两分钟生成和继续延展,但场景越长、角色越多,音色、空间和叙事节奏的控制难度越高。

正式项目仍需要混音

模型可以生成完整场景,但商业影视和游戏通常仍需进行对白分离、响度调整、降噪和母带处理。

参考声音需要合法授权

未经同意复刻真实人物声音,可能涉及肖像、人格、隐私和商业权益问题。

多语种效果可能存在差异

官方评测显示不同语言之间的自然度和指令遵循表现并不完全一致,目标市场上线前仍需由母语使用者检查。

生成内容可能出现错误

模型可能生成与场景不符的声音、不准确发音或节奏问题,不能直接跳过人工审核。

字节跳动的AI音频布局

Seed Audio 1.0并不是字节跳动在语音和音频领域的第一个模型。

Seed团队此前已经推出或研究:

  • Seed-TTS语音合成模型
  • Seed-ASR语音识别模型
  • Seed-Music音乐生成系统
  • Seedance音视频联合生成模型
  • 豆包语音合成和声音复刻服务

Seed-TTS侧重高质量人声与音色学习,Seed-ASR负责识别多语言、方言和复杂语音,Seed-Music面向音乐创作,Seedance则负责视频与声音联合生成。

Seed Audio 1.0进一步将语音、音效和环境声整合到完整声音场景中,补充了独立音频创作环节。

AI音频工具会如何改变内容生产?

过去,一段完整音频通常需要配音演员、录音师、音效师和混音师共同完成。

Seed Audio 1.0可以降低早期创作和样片制作的门槛,让创作者快速验证:

  • 角色声音是否合适
  • 场景氛围是否成立
  • 台词节奏是否匹配画面
  • 音效应该在哪里出现
  • 多语种版本是否可行

但对于精品内容,人工专业能力仍然重要。

AI可以帮助生成草稿、补充素材和减少重复操作,创作者仍需负责表演指导、声音设计、版权、文化表达及最终质量。

后续将增加哪些能力?

字节跳动已经公布Seed Audio后续计划,包括:

  • 将精细时间控制扩展至音效、环境声和音乐
  • 提高更长、更复杂场景中的音色一致性
  • 支持视频参考输入
  • 增强长篇音频生成
  • 探索多轨音频生成
  • 支持可控多语种翻译
  • 加强跨语言时间与时长管理

其中,多轨生成值得关注。

当前端到端音频通常直接输出混合后的完整结果,如果未来能够分别输出对白、音效、环境声和音乐轨道,专业用户就可以在剪辑软件中进行更细致的调整。

总结

Seed Audio 1.0是字节跳动Seed团队推出的场景级音频创作模型。

它可以在统一框架中生成角色对白、音效、环境声及其他音频元素,并结合人物、情绪、时间和空间信息形成完整声音场景。

模型当前支持100毫秒级角色对白时间控制、通过文字或授权参考音频创建音色、单次最长约两分钟生成及继续延展,并覆盖20余种语言。

Seed Audio 1.0已经通过BytePlus和火山引擎提供音频生成服务,开发者可通过HTTP接口调用seed-audio-1.0模型。

这次发布的核心并不只是让AI语音听起来更加自然,而是让模型开始理解一个声音场景应该如何组织:谁先说话、声音来自哪里、情绪如何变化,以及音效怎样服务叙事。

不过,当前的精细时间控制仍主要面向对白,长场景一致性、多轨编辑和复杂声音元素控制还需要继续完善。对于正式影视、广告和游戏内容,人工审核与专业混音依然不可缺少。

相关链接