由于Mathpix开始收费,我们特地制作了一款开源免费的ASR工具本地整合包,只需简单点击即可使用,避免了配置Python环境可能遇到的各种问题。

一、ASR是什么?

ASR全称Automatic Speech Recognition,自动语音识别也称为语音转文本(STT),是将给定音频转录为文本的任务。它有很多应用,例如语音用户界面。

二、ASR的项目地址

三、ASR的使用场景

  1. 虚拟语音助手
    • 许多边缘设备都有嵌入式虚拟助手,可以更好地与最终用户交互。这些助手依靠ASR模型来识别不同的语音命令以执行各种任务。例如,您可以要求手机拨打电话号码、询问一般性问题或安排会议。
  2. 字幕生成
    • 字幕生成模型将音频作为输入,通过转录为直播或录制的视频生成自动字幕。这有助于内容的可访问性。例如,观看包含非母语视频的观众可以依靠字幕来理解内容。它还可以帮助在线课程环境中的信息保留,提高知识同化,同时更快地阅读和做笔记。

四、如何使用ASR?

为了让更多用户能够轻松体验这一技术,我们将ASR打包成了一键启动包。现在,您无需繁琐地配置Python环境,只需简单点击即可启动程序,从而避免了潜在的环境配置问题。

使用步骤

  1. 下载压缩包,并解压到电脑D盘(最好不要有中文路径)。
  2. 解压后点击启动.bat文件即可运行(文件可能会被误杀,请添加为信任)。
  3. 浏览器访问:http://127.0.0.1:7860/,即可正常使用。
通过这些简单的步骤,您就能轻松使用ASR工具,将音频快速转换为可编辑的文本,为您的日常任务和工作提供极大便利。