Meta AI 推出的 AudioCraft 是一款免费的开源深度学习库,专为音频处理和生成而设计。该库集成了最先进的音频压缩、音乐生成和声音生成技术,是音频处理领域的一大利器。下面为大家详细介绍 AudioCraft 及其使用方法。

一、AudioCraft是什么?

AudioCraft 是 Meta AI 免费开源的一款深度学习音频处理和生成库。它可以满足您所有的生成音频需求,包括音乐、音效以及原始音频信号训练后的压缩。其核心组件包括最先进的 EnCodec 音频压缩器/标记器和 MusicGen,一种简单可控的音乐生成语言模型 (LM),支持文本和旋律调节。MusicGen 的训练使用了2万小时的授权音乐。

二、AudioCraft的项目地址

  1. Github地址AudioCraft Github
  2. 项目地址AudioCraft 官网
  3. 论文地址AudioCraft 论文
  4. 样本演示MusicGen 演示
  5. 在线试用MusicGen 在线试用
  6. 模型下载MusicGen 模型下载

三、AudioCraft的技术剖析

模型架构

MusicGen 和 AudioGen 都包含一个自回归语言模型 (LM),在压缩的离散音乐表示流(即标记)上运行。以下是核心技术点:

  1. 自回归语言模型:对离散音频标记进行递归建模,捕获音频中的长期依赖性。
  2. EnCodec 神经音频编解码器:从原始波形中学习离散音频标记,并将音频信号映射到一个或多个离散令牌的并行流。
  3. 生成音频:使用单个自回归语言模型,对来自 EnCodec 的音频标记进行递归建模,生成的令牌被馈送到 EnCodec 解码器,将它们映射回音频空间以获得输出波形。
  4. 条件控制:使用预训练的文本编码器进行文本到音频的生成控制。

模型概述

AudioCraft 包含以下训练代码和推理代码:

  1. MusicGen:最先进的可控文本到音乐模型。
  2. AudioGen:最先进的文本到声音模型。
  3. EnCodec:最先进的高保真神经音频编解码器。
  4. Multi Band Diffusion:使用扩散的 EnCodec 兼容解码器。
  5. MAGNeT:最先进的文本到音乐和文本到声音的非自回归模型。

四、怎么使用AudioCraft?

为了让更多用户能够轻松体验这一技术,我们将 AudioCraft 打包成了一键启动包。现在,您无需繁琐地配置 Python 环境,只需简单点击即可启动程序,从而避免了潜在的环境配置问题。

使用步骤

  1. 下载压缩包,并解压到电脑D盘(最好不要有中文路径)。
  2. 解压后点击 启动.bat 文件 即可运行(文件可能会被误杀,请添加为信任)。
  3. 浏览器访问http://127.0.0.1:7860/,即可正常使用。

通过这些简单的步骤,您就能轻松使用 AudioCraft 工具,进行高效的音频处理和生成,为您的音频项目提供强大的技术支持。