
Fish Audio 发布新一代 TTS 模型 S2
AI 语音技术公司 Fish Audio 近日发布了新一代 文本转语音(TTS)模型 S2。该模型在语音情绪表达和可控性方面进行了显著提升,并以 完全开源的方式发布。
项目地址:
https://github.com/fishaudio/fish-speech/
模型下载:
https://huggingface.co/fishaudio/s2-pro/
S2 模型支持 多说话人语音合成与细粒度情绪控制,适用于实时语音应用场景。
词级情绪控制能力
S2 的一个重要特点是 词级或短语级情绪控制。
开发者可以通过自然语言或指令来调整语音表达,例如:
- 改变语音情绪
- 调整语速与节奏
- 控制语气变化
这种细粒度控制方式能够生成更自然、更富表现力的语音。
支持多说话人语音
S2 模型原生支持 多说话人语音生成。
主要能力包括:
- 不同角色音色生成
- 对话轮流发声
- 保持角色声音一致
这种能力非常适合构建多角色语音场景。
完全开源
Fish Audio 将 S2 模型 完整开源,提供以下资源:
- 模型权重
- 微调代码
- 推理框架
- 流式推理引擎
这使开发者可以根据需求进行训练或部署。
适合实时语音应用
S2 模型在设计时特别考虑了 实时应用场景。
适用领域包括:
对话机器人
AI 助手可以通过自然语音进行交流。
虚拟主播
支持动态语音表达和情绪变化。
AI 语音助手
可以生成更自然的语音反馈。
游戏角色语音
用于生成 NPC 或角色语音。
AI 语音技术的发展趋势
近年来,TTS 技术正朝着更高质量和更强控制能力发展。
主要趋势包括:
- 情绪表达更加丰富
- 多说话人支持
- 实时语音生成
- 开源模型生态
S2 的发布进一步推动了开源语音模型的发展。
总结
Fish Audio 发布的 S2 开源 TTS 模型在语音情绪控制和多说话人能力方面带来了新的进展。
项目地址:
https://github.com/fishaudio/fish-speech/
模型下载:
https://huggingface.co/fishaudio/s2-pro/
该模型支持词级情绪控制、实时语音生成以及完整开源资源,为对话机器人、虚拟主播和语音应用提供了新的技术选择。








评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。