Easy-Wav2Lip是什么?

Easy-Wav2Lip是Wav2Lip的改进版本,在设计上更为简洁,执行速度更快,同时生成的视频效果更加逼真。Wav2Lip技术可以让视频中的人物根据输入的音频生成匹配的唇形动作,从而实现口型与语音同步的效果。这项技术不仅适用于静态图像,还能够对动态视频进行处理,生成与目标语音同步的视频输出。

Easy-Wav2Lip的项目地址

  1. Github仓库: https://github.com/anothermartz/Easy-Wav2Lip
  2. 在线试用: https://colab.research.google.com

Easy-Wav2Lip的特点优势

以Colab T4环境下处理一段9秒钟、720p、60fps的测试视频为例,Easy-Wav2Lip将处理时间从原来的近7分钟显著缩短至不到1分钟。

原始Wav2LipEasy-Wav2Lip
执行时间6分53秒

Easy-Wav2Lip完美修复了嘴唇上的视觉错误,并提供三种不同的品质选项:

  • 快速:基础的Wav2Lip效果
  • 改进:在Wav2Lip基础上增加羽化口部遮罩,同时保留面部其他部分的原始分辨率
  • 增强:结合Wav2Lip、遮罩和GFPGAN技术,对面部进行全面提升

Easy-Wav2Lip的注意事项

为了获得最佳效果,请在通过Wav2Lip发送语音之前将语音与说话者的动作和表情对齐!

视频文件

  1. 所有帧中必须有一张脸,否则Wav2Lip将失败
  2. 裁剪或遮盖不想口型同步的面孔,否则会随机选择
  3. 使用h264 .mp4文件,其他类型可能支持但不保证
  4. 图像目前未经测试
  5. 尽量使用小文件(尝试 <720p、<30秒、30fps 等),较大的文件可能会导致失败
  6. 初次尝试使用一个非常小的剪辑,熟悉后再尝试更大的文件

音频文件

  1. 保存为.wav,长度与输入视频相同
  2. 注意处理后的视频/音频会缩短大约80毫秒,确保有足够的时间余量
  3. 可以将音频编码到视频文件中并将vocal_path留空,但这会增加处理时间
  4. 单独选择音频文件,至少支持.wav和.mp3格式

如何使用Easy-Wav2Lip

为了让更多用户能够轻松体验这一技术,我们将Easy-Wav2Lip打包成了一键启动包。现在,您无需繁琐地配置Python环境,只需简单点击即可启动程序,从而避免了潜在的环境配置问题。

  1. 下载压缩包,解压到电脑D盘,最好不要有中文路径
  2. 解压后点击启动.bat文件即可运行(文件可能会被误杀,请添加为信任)
  3. 浏览器访问:http://127.0.0.1:7860/,即可正常使用