Fish Audio 发布新一代 TTS 模型 S2

AI 语音技术公司 Fish Audio 近日发布了新一代 文本转语音(TTS)模型 S2。该模型在语音情绪表达和可控性方面进行了显著提升,并以 完全开源的方式发布。

项目地址:
https://github.com/fishaudio/fish-speech/

模型下载:
https://huggingface.co/fishaudio/s2-pro/

S2 模型支持 多说话人语音合成与细粒度情绪控制,适用于实时语音应用场景。


词级情绪控制能力

S2 的一个重要特点是 词级或短语级情绪控制

开发者可以通过自然语言或指令来调整语音表达,例如:

  • 改变语音情绪
  • 调整语速与节奏
  • 控制语气变化

这种细粒度控制方式能够生成更自然、更富表现力的语音。


支持多说话人语音

S2 模型原生支持 多说话人语音生成

主要能力包括:

  • 不同角色音色生成
  • 对话轮流发声
  • 保持角色声音一致

这种能力非常适合构建多角色语音场景。


完全开源

Fish Audio 将 S2 模型 完整开源,提供以下资源:

  • 模型权重
  • 微调代码
  • 推理框架
  • 流式推理引擎

这使开发者可以根据需求进行训练或部署。


适合实时语音应用

S2 模型在设计时特别考虑了 实时应用场景

适用领域包括:

对话机器人

AI 助手可以通过自然语音进行交流。


虚拟主播

支持动态语音表达和情绪变化。


AI 语音助手

可以生成更自然的语音反馈。


游戏角色语音

用于生成 NPC 或角色语音。


AI 语音技术的发展趋势

近年来,TTS 技术正朝着更高质量和更强控制能力发展。

主要趋势包括:

  • 情绪表达更加丰富
  • 多说话人支持
  • 实时语音生成
  • 开源模型生态

S2 的发布进一步推动了开源语音模型的发展。


总结

Fish Audio 发布的 S2 开源 TTS 模型在语音情绪控制和多说话人能力方面带来了新的进展。

项目地址:
https://github.com/fishaudio/fish-speech/

模型下载:
https://huggingface.co/fishaudio/s2-pro/

该模型支持词级情绪控制、实时语音生成以及完整开源资源,为对话机器人、虚拟主播和语音应用提供了新的技术选择。