美团 LongCat 团队近日推出了 SOTA 级虚拟人视频生成模型 LongCat-Video-Avatar,该模型在长视频生成领域表现优异,尤其是在动作拟真、长视频稳定性和身份一致性方面,展现了强大的应用潜力。LongCat-Video-Avatar 支持多任务生成功能,并采用创新的训练策略,提升了长视频生成的质量。
官方开源入口:https://github.com/meituan-longcat/LongCat-Video


一、LongCat-Video-Avatar 多任务支持

LongCat-Video-Avatar 支持多种生成任务,特别适合多样化的创作需求:

  • Text-to-Video:根据文本描述生成虚拟人视频;
  • Image-to-Video:将静态图像转为动态虚拟人视频;
  • Video-to-Video:在已有视频基础上进行风格或动作迁移。

这种多任务能力让创作者可以根据不同需求灵活选择输入模式,提升创作效率。


二、Cross-Chunk Latent Stitching 训练策略

LongCat-Video-Avatar 引入了创新的 Cross-Chunk Latent Stitching 训练策略,显著提升了长视频生成的质量:

  • 长视频生成稳定性:长时间视频中的动作和情感保持一致,避免了常见的身份和动作偏差;
  • 高拟真度动作:通过高效训练确保虚拟人动作更加自然流畅,避免了“僵硬”现象。
    这种策略确保了长视频中的虚拟人角色能够持续展现一致的面部表情和肢体动作。

三、SOTA 水平的评测成绩

LongCat-Video-Avatar 在多个数据集上的评测结果达到 SOTA(State of the Art) 水平,展现了强大的生成能力和应用潜力:

  • HDTFCelebV-HQ 数据集上表现优异,达到了行业领先水平。
  • 强大的表现使其在虚拟人直播、游戏制作、影视创作等领域具有广泛应用前景。

四、应用前景与行业价值

LongCat-Video-Avatar 的应用潜力不仅局限于视频生成,还可广泛应用于以下领域:

  • 虚拟人直播与短视频创作:帮助创作者生成高度拟真的虚拟人物并进行长时间表现;
  • 游戏与影视:快速制作高质量虚拟角色动画,丰富游戏和电影中的人物表现;
  • 教育与培训:生成动态虚拟讲师或教学视频;
  • 企业营销与虚拟客服:为品牌提供虚拟代言人或智能客服。

✅ 五、总结

美团 LongCat 团队推出的 LongCat-Video-Avatar,是一款在长视频生成领域表现出色的虚拟人视频生成模型。通过 Cross-Chunk Latent Stitching 训练策略 和多任务支持,LongCat-Video-Avatar 在 生成质量动作自然度长视频稳定性 上取得了突破性进展。
无论是 虚拟人直播、短视频创作,还是 游戏和影视制作,LongCat-Video-Avatar 都展示了强大的应用前景。

官方开源入口:https://github.com/meituan-longcat/LongCat-Video