一、Step-Audio-R1.1发布:全球领先的语音理解与推理模型

AI 科技公司 阶跃星辰(StepFun AI) 正式推出最新语音模型 Step-Audio-R1.1
该模型在国际权威评测中以 96.4% 的语音理解准确率 位列全球第一,展现出在语音推理、实时响应多模态理解领域的卓越性能。

访问详情与模型下载:
https://huggingface.co/stepfun-ai/Step-Audio-R1.1


二、核心亮点与技术特性

1. 深度语音推理能力:理解超越识别

不同于传统语音识别(ASR)系统仅停留在“听懂”的层面,Step-Audio-R1.1 拥有深度语音推理能力(Audio Reasoning)
它不仅能识别语音文字,还能理解语义意图、语气变化与上下文逻辑,从而实现真正的“语音理解”,在多轮语音交互和实时决策场景中表现突出。

2. 实时响应与流式推理支持

Step-Audio-R1.1 支持 Streaming Inference(流式推理),可实现低延迟的语音输入输出。
无论是语音助手、AI客服,还是会议同传与交互机器人,该模型都能在毫秒级响应的基础上保持高准确率和自然流畅的对话体验。

3. 开放可用,生态兼容性强

模型已在 HuggingFace 平台上开源,用户可免费下载并在多种框架环境中运行,包括 PyTorch、TensorFlow 与 ONNX Runtime。
同时,阶跃星辰提供开放平台试用入口,方便开发者快速集成语音推理能力到实际应用中,覆盖教育、智能硬件、内容生成等多种行业场景。


三、国际评测结果:96.4% 准确率登顶全球

在最新的国际语音智能评测中,Step-Audio-R1.1 凭借 96.4% 的平均准确率 荣登全球榜首。
评测涵盖多语言语音理解、噪声环境识别、语义匹配与情感识别四大维度。该模型在所有维度中均表现稳定,特别在多语言语义一致性实时响应延迟指标上领先全球主流语音模型。


四、行业意义:语音智能进入推理时代

Step-Audio-R1.1 的发布标志着语音AI从“识别阶段”正式迈入“推理阶段”。
在传统语音识别的基础上,模型通过语义链建模、声学理解和上下文逻辑分析,使AI系统能够:

  • 理解语音背后的意图与推理逻辑
  • 实现自然语言与语音的无缝融合
  • 支持多模态感知与多任务处理

这一技术进展将广泛应用于智能客服、虚拟助手、语音创作、教育辅导及车载语音系统等领域,为语音交互体验带来质的飞跃。


五、阶跃星辰的AI语音生态布局

阶跃星辰在语音智能领域持续深耕,从语音识别、说话人识别到语音生成与推理,已构建完整的AI语音生态链。
Step-Audio-R1.1 的问世,不仅是单一模型的突破,更是阶跃星辰自研算法、国产算力与开放生态协同发展的成果。
未来,团队将继续推动语音智能技术的开放共享,助力全球开发者快速构建创新语音应用。

访问模型主页与开放平台体验:
https://huggingface.co/stepfun-ai/Step-Audio-R1.1