在人工智能语音领域,通义百聆再次带来了重磅更新。本次发布中,阿里正式推出了 Fun-CosyVoice3 系列语音合成模型Fun-ASR 系列语音识别模型 的全面升级,覆盖从语音克隆、情绪控制到跨语种识别等多项核心能力。
仅需 3 秒录音,AI 即可实现多语言、方言、情绪切换;在嘈杂环境下,依然能实现毫秒级精准识别。无论是语音助手、会议纪要、短视频配音还是智能客服,Fun-CosyVoice3 与 Fun-ASR 都能提供更自然、更高效的智能语音体验。


一、Fun-CosyVoice3 模型:3秒录音即可多语种情绪复刻

✅ 核心亮点

  • 首包延迟降低 50%,中英混说准确率提升一倍;
  • 支持 9 种通用语言、18 种方言,具备跨语种音色克隆与情感控制;
  • 双向流式合成 实现“输入即发声”,满足语音助手、直播配音、无障碍阅读等实时需求。

Fun-CosyVoice3 可以通过一段 3 秒录音,实现不同语言、方言与情绪的高保真音色复刻。无论是普通话转粤语、英语还是日语,AI 都能保持原音音色一致,让声音表达更自然、更具感染力。

案例展示:

  • 案例1:中英混说精准发音 “上面的 oversize 的衣服就不要选择这么大,你可以稍微再缩小一点点版型。”
  • 案例2:跨语种音色复刻能力
  • 案例3:韵律提升与多音字识别 “他把数据输入电脑,开始数数。”

模型体验地址(阿里云百炼)

https://bailian.console.aliyun.com


二、Fun-CosyVoice3-0.5B 开源:Zero-shot 音色克隆与本地部署支持

Fun-CosyVoice3-0.5B 是轻量化版本,具备 zero-shot 音色克隆能力。用户只需提供一段 3 秒以上参考音频,即可快速复刻其音色并生成新语音。
该模型支持 本地部署、二次开发,为企业及开发者提供灵活的语音合成解决方案。

开源地址


三、Fun-ASR 模型:AI “听得懂” 的语音识别系统

如果说 CosyVoice3 让 AI “会说话”,那 Fun-ASR 则让 AI 真正“听得懂”。

Fun-ASR 是通义百聆推出的端到端语音识别大模型,基于数千万小时语音数据训练,已广泛应用于 钉钉AI听记、视频会议、语音助手等场景
本次升级显著提升了噪声环境下的鲁棒性、多语言混说能力及定制化精度。

✅ 模型亮点:

  • 噪声场景准确率 93%,支持音乐、RAP、嘈杂环境下识别;
  • 支持 31 种语言自由混说,无须指定语种自动识别;
  • 7 大中文方言 + 26 种口音 精准识别;
  • 流式识别首字延迟仅 160ms,识别更快。

案例展示:

  • 案例5:嘈杂环境识别 “然后被冠以了渣男线的称号……前方即将到达沈杜公路站,左边是8号线。”
  • 案例6:多语言识别(日英混说) “このカフェの Wi-Fi がアンステーブルすぎて…”
  • 案例7:方言覆盖(粤语) “佢最想要有露台,佢想感受那个国家嘅生气…”

模型体验地址(阿里云百炼)

https://bailian.console.aliyun.com


⚙️ 四、Fun-ASR-Nano-0.8B 开源:更轻量、更高效

全新推出的 Fun-ASR-Nano 模型在保持高精度的同时,将参数量压缩至 0.8B,极大降低了推理成本,适合移动端与边缘设备部署。

开源地址


五、面向企业与开发者的智能语音生态

通义百聆的 Fun 系列模型不仅面向普通用户,也为企业和开发者提供了定制化能力:

  • RAG 检索增强生成机制:热词上限提升至 10,000 条,专有名词识别更精准;
  • 多语种场景适配:覆盖金融、医疗、教育、娱乐等领域;
  • 支持私有化与本地部署:保障数据安全与低延迟响应;
  • 开放 API 与 SDK:方便开发者快速集成 AI 语音能力。

这些特性让 Fun-CosyVoice3 与 Fun-ASR 成为智能语音产品、内容平台和企业级系统的理想基础组件。


✅ 总结

本次 通义百聆 Fun 系列模型升级,在语音合成与语音识别两大方向上实现了显著性能提升。

  • Fun-CosyVoice3 让 AI 能“说出”多语种、多情感、高保真音色;
  • Fun-ASR 让 AI 能“听懂”复杂环境、多方言、多语种语音。

二者相辅相成,构建出更完善的语音智能生态,为用户和开发者提供从“说”到“听”的全链路AI能力。