智谱 AI 全新发布桌面输入法,GLM-ASR 语音识别技术正式开源

随着语音交互技术在办公、内容创作、实时沟通中的应用越来越普遍,用户对于高精度语音识别的需求不断提升。智谱 AI 近日正式发布了 GLM-ASR 系列语音识别模型,并同步开源完整技术方案,进一步降低了企业与开发者在语音 AI 领域的技术门槛。同时,全新的 智谱 AI 桌面输入法 也正式亮相,为电脑端用户带来更加自然、顺畅、高效的语音输入体验。

这次双重发布,使用户既能使用强大的桌面输入法,也能直接基于开源模型进行定制和集成,为多种实际场景提供灵活可靠的语音交互能力。


GLM-ASR 系列模型:云端与端侧兼具的语音识别体系

GLM-ASR 系列作为智谱 AI 新一代语音识别模型,包含多种不同规格的模型版本,以满足广泛的使用场景和性能需求。其中重点包括:

● GLM-ASR-2512:面向高精度场景的云端语音识别模型

该模型适用于对识别质量要求极高的任务,例如:

  • 长语音会议记录
  • 专业访谈转写
  • 内容创作口述
  • 多人会话识别

它在复杂语音条件(例如口音杂音、语速较快的口述)中仍能保持良好的识别性能,是生成式 AI 语音能力的重要基石。


● GLM-ASR-Nano-2512:轻量化端侧模型,离线可用

相比大型云端模型,Nano 版本具备更强灵活性

  • 模型体积更小
  • 本地运行速度快
  • 离线场景依旧稳定识别
  • 数据无需上传,更符合隐私要求

这类模型非常适合部署在本地输入法、车载系统、移动设备等场景中,保证用户在无网络或弱网环境中仍能完成语音输入。

开发者可通过官方页面获取模型:

https://huggingface.co/zai-org/GLM-ASR-Nano-2512

模型开源意味着团队可以将其集成到自己的应用中,例如客服机器人、语音备忘应用、智能工具软件等,极大提升了二次开发的灵活性与可控性。


智谱 AI 桌面输入法:让语音成为高效办公的自然入口

不同于手机端以语音代替打字的轻度场景,电脑端的需求更偏向专业场景,如文稿写作、会议记录、直播字幕、跨语言沟通等。因此这一次智谱 AI 输入法重点优化了以下体验:

● 1. 高效语音转文字

用户可通过麦克风直接口述,系统会实时识别并生成准确文本,适合:

  • 快速整理会议纪要
  • 写作思路口述/草稿生成
  • 视频脚本或文章初稿
  • 程序员用语音输入注释

在长语音场景中,系统能够保持稳定识别不中断,并可自动处理语气词、重复词等常见口语表达。


● 2. 多语言语音翻译

输入法内置语音翻译功能,适用于跨境沟通、学习与国际化办公:

  • 中文 → 英文
  • 英文 → 中文
  • 其他语言模型可拓展

在实时沟通场景中,用户可以直接口述,系统自动识别、翻译并呈现目标语言文本,显著减少处理时间。


● 3. 文本改写与语言表达优化

借助大模型能力,输入法支持自动对内容进行:

  • 表达润色
  • 风格调整
  • 格式优化
  • 简繁转换
  • 内容精简或扩写

非常适合写作、客户沟通、公众号内容创作等场景,大幅提升办公效率。


面向用户的体验福利:2000 积分 + 最长 28 天免费使用

为了让更多用户感受到语音输入的便利,智谱 AI 推出了面向新用户的福利:

  • 免费获取 2000 积分
  • 可连续体验长达 28 天

用户无需承担成本即可体验完整功能,包括语音识别、翻译、改写和多种智能输入增强能力。


开源语音识别的意义:更开放、更易用、更可拓展

GLM-ASR 系列的开源不仅有助于推动语音技术普及,也让更多开发者能将其应用到不同的行业与产品中。例如:

  • 智能客服
  • 在线课堂转写
  • 车载语音控制
  • 内容创作辅助工具
  • 企业内部知识库语音录入
  • 智能会议系统

开源模型及完整的输入法工具链,让用户从基础技术到最终应用都能找到适合的解决方案。


总结:语音交互进入更智能、更普及的阶段

智谱 AI 通过 GLM-ASR 模型开源与桌面输入法发布,让语音输入不再是移动端的专属体验,而是电脑端办公与创作的重要工具。高精度识别能力、多场景适配和隐私友好的端侧部署,使语音技术真正走向更多用户与企业的实际需求。

未来,随着开发者在开源模型基础上不断构建应用生态,语音 AI 在效率、便利性与行业使用深度上都将持续提升。