一转眼已经到年末了,从去年就预言的“2024是AI视频的元年”,如今看来事实确实如此,随着开山鼻祖sora也开放了使用权限,各家公司都在今年拿出了自己的看家本领,无数的AI视频作品层出不穷,百花齐放。
而在国内最引人瞩目的就是豆包视频生成模型PixelDance(豆包PixelDance)和可灵了,对于它们两者的比较,相信会有很多人关注。随着11月份即梦AI全量开放了豆包 Pixeldance(产品内命名为P2.0pro),我们有机会测评一下豆包的 Pixeldance对比可灵最新的1.5模型,在各方面的表现孰优孰劣。
由于视频模型已经发展了将近一年的时间了,所以这次的测试我会抛开那些几乎人人都会的基础运动,而去极限测试一下这两款模型在多镜头切换、时序镜头,焦距变化等更复杂的提示词的表现情况。图生视频
在AI视频的商业性领域,最常用的还是图生视频了。因为从目前我接触的商业落地的项目来看,主要有文旅片、广告片、故事片这几个类型。
文旅片需要有城市景点和特色建筑的出现、广告片需要有甲方产品的出现、故事片需要有特定人物角色的一致性表现。这些需求都是文生视频无法做到的,所以我们的做法还是会先对单帧图片做处理,然后再进行图生视频。我判断一个AI图生视频模型的好坏,一般会从以下几个方面
- 它的语义理解如何,能否能根据我的文字提示做出图片后续的发展?
- 它的主体一致性如何,能否在后续的各种运动中保证主体的不发生太大的变化?
- 它的运动幅度如何,能否在需要激烈运动的画面时绘制出相应幅度的运动?
- 它的运镜能力如何,能否做出推拉摇移等影视级运镜来丰富视觉效果?
- 它的画面质量如何,能否有优质的画面表现也是商业化中很重要的一环,虽然目前的市场上客户会对AI的视频有所包容,但是各家的模型一定会往更高的分辨率去发展。
介绍完我的分析方法,接下来就是详细的对比案例,我会从场景类、人像类、动物类、奇幻类、卡通类这五个测试场景中各出一些有代表性的图片,然后用同样的提示词分别给到豆包Pixeldance和可灵1.5,每个模型进行三轮测试出视频,选择表现最好的出来对比,并给出我心目中的评分(每个片段按照综合表现评出星数,满分5星)。
01场景类
场景类的视频一般会在文旅片中出现,主要考察对主体建筑和物体的保持度。在拍摄风景很少需要大幅度的运动,但是对运镜是有一定要求的,我往往会需要镜头更稳定,而不是增加很多我不需要的元素。

提示词:这是一个静物展示,镜头围绕主体360度旋转,逆时针旋转拍摄,围绕主体拍摄,逆时针环绕一周拍摄。

↑ 豆包Pixeldance

↑ 可灵1.5
#点评
这是关于场景物体旋转角度的一个极限测试,在10秒的运动时间里,豆包Pixeldance拥有更大的旋转角度,可灵1.5运动比较缓慢,且蝴蝶出现了穿模的情况。
豆包Pixeldance ★★★★☆
可灵1.5 ★★★☆☆

提示词:第一人称视角,镜头推进,飞船迅速左右偏转,击中前方飞机,火光,爆炸


#点评
宇宙飞船在快速飞行中基本上保持了很好的一致性,机身上的光影变化随着周围火光都有很真实的反馈,在镜头的表现上,豆包Pixeldance击中了前方战机,可灵1.5做出了左右偏转的效果,各有优劣。
豆包Pixeldance ★★★★☆
可灵1.5 ★★★★☆

提示词:高速追踪镜头,跑车在极速前进,朝镜头驶来,冰雪急速飞溅,轮胎带起金属般炫亮的火花, 隧道冰壁崩裂,车头车灯瞬间照亮整个隧道。


#点评
车是一个速度感很强的主体,豆包Pixeldance展现出了很大的运动幅度,体现出了极速的概念,不过在后续的行驶中,整个视频的主色调离原图差距较大。可灵1.5运动的距离短一些且运动速度不够快,不过整体色调的一致性保持的更好,而且车与地面的交互更真实。
豆包Pixeldance ★★★★☆
可灵1.5 ★★★★☆
02人像类
人像类视频的核心在于保持人物一致性的同时,又能够表达出人物的情绪、动作,以及和周围环境的互动,面部表情要生动且自然。

测试图片2-1
提示词:
镜头一:特写镜头,金色的夕阳透过舞蹈室窗户洒下温暖光芒,映照在一双优雅的芭蕾舞鞋上,脚趾踮起,完美的弯曲,鞋带轻微摆动,背景模糊成暖黄色的光斑。
镜头二:镜头缓慢上移,展现舞者的身影,芭蕾舞裙随着舞步飘动,优雅的身体线条与夕阳交织成一幅动人画面,光线洒在她的肩膀与舞动的裙摆上,营造出一丝梦幻般的氛围。
镜头三:镜头拉远,舞者在空旷的舞蹈室中舞蹈,金色光辉柔和地洒在木地板上,舞者的动作逐渐缓慢,仿佛时间在这一刻凝固,舞蹈与夕阳交织,传递出宁静与专注的美好情感。

↑ 豆包Pixeldance

↑ 可灵1.5
#点评
多场景切换叙事能力测试,描绘了一个舞者在舞房练舞的场景,豆包Pixeldance很好的通过一个上拉镜头展现了舞者的姿态,然后切换到一个全景,表现整个练舞的空间。而可灵1.5的并没有出现画面的变化,也没有展现出舞者的动作。
豆包Pixeldance ★★★★★
可灵1.5 ★☆☆☆☆

测试图片2-2
提示词:一个男人和一个女人在酒吧聊天,变换焦距,从女人的脸部聚焦到前景的男人,男人逐渐变清晰,无奈撇开脸,女人逐渐变模糊

↑ 豆包Pixeldance

↑ 可灵1.5
#点评
焦点变换是在影视类片子当中经常使用的技巧,在这个案例当中豆包Pixeldance成功的实现了变焦效果,从女人切换到了前景的男人,而可灵1.5只做到了缓慢推镜头,没有变焦的表现。
豆包Pixeldance ★★★★★
可灵1.5 ★★☆☆☆

测试图片2-3
提示词:戴着帽子的老年西部牛仔,形象沧桑,他先无奈的摇头笑了笑,随后他微微低下头,他的左手缓缓地把头上的帽子拿了下来,露出老人花白的头发。他把帽子放在了桌面上,然后他缓慢站起身,拿起桌上的酒瓶,转身离开,随后镜头聚焦到桌面上的帽子。还有其他客人走来走去。

↑ 豆包Pixeldance

↑ 可灵1.5
#总结点评
在这一连串的复杂命令中,豆包Pixeldance准确地用左手拿下了帽子,离开时拿走了酒瓶,环境中也有人物在走动,环境氛围非常不错。可灵1.5只出现了取下帽子的动作,但是却忽略了桌上酒杯。
这个案例其实很好的反应出了豆包Pixeldance模型在语义理解和动作幅度上强大的能力,有很高的上限水平。
豆包Pixeldance ★★★★★
可灵1.5 ★★★☆☆

测试图片2-4
提示词:圣诞老人站在挂满灯串的树前面,右手从口袋里面拿出一个苹果咬了一口,左手比耶,一只驯鹿从身后跑来。


#点评
测试模型对于一连串动作的生成能力,豆包Pixeldance生成的圣诞老人做出了所有的动作,画面的空间处理的非常好,驯鹿由远及近,画面也是由虚到实。而可灵1.5的圣诞老人没有笔出手势,驯鹿的镜头也进行了切换,没能在一个场景中完成。
豆包Pixeldance ★★★★★
可灵1.5 ★★☆☆☆03动物类
普通的动物我觉得以目前AI发展的水平,这两个模型应该都不会有什么问题。但是当我让这些动物做一些复杂的交互、或者是拟人化之后,AI是否能理解这个事情,并且做出合理的运动姿态,这是我感兴趣的地方。

提示词:微距视角轻轻推近, 小男孩微微向前递出棒棒糖,金毛犬身体晃动,尾巴摆动,舔了一口棒棒糖,跑走了,背景有树叶落下,镜头最终聚焦在两者交汇的眼神中,传递纯真的互动与暖意。


#点评
这是一个人与宠物的互动场景,提示词的需求是“小狗舔一下棒棒糖,跑走”,豆包Pixeldance做出了所有的动作,并且小狗跑掉的过程中遮挡了小孩,但是小孩再次出现时,面部的一致性依旧保持得很好,而可灵1.5的小狗并没有吃到棒棒糖,而且小孩在随后的张嘴表情有些过于夸张,不够自然。
豆包Pixeldance ★★★★★
可灵1.5 ★★☆☆☆

提示词:微距镜头缓缓拉近,柔和暖光笼罩场景 ,一只萌态十足的蜜蜂,明亮的大眼睛,轻轻颤动的透明翅膀,蜜蜂站在发出微光的蘑菇上,细小前足轻点表面,身体微微起伏仿佛呼吸, 周围发光的花朵与蘑菇交替闪烁,背景中光点如精灵般漂浮,森林深处氤氲的蓝光隐现,营造奇幻童话般的温馨与梦幻氛围。


#点评
测试昆虫类的动物形态,豆包Pixeldance的蜜蜂翅膀拍打符合逻辑,表情动态也很生动,可惜镜头没有运动。可灵1.5没有保持形象的统一,产生了很大的形变,而且飞翔的姿态也错误。
豆包Pixeldance ★★★★☆
可灵1.5 ★★☆☆☆

测试图片3-3
提示词:老虎脑袋一歪,打了个哈欠,右手放下笔,左手翻了一页书。


#点评
老虎的面部表情和姿态控制,豆包Pixeldance精准的还原了“打哈欠”这个动作,可灵1.5只做出了翻书的动作,还有一个额外的动作,扶了一下眼镜,但是却导致了眼镜的变形,这样的“加戏”反而破坏了画面。
豆包Pixeldance ★★★★★
可灵1.5 ★★☆☆☆
04奇幻类
这里包括一些神话和科幻的主题,完全是人类臆想出来的世界与奇观,在AI故事短片中是一条非常热门的赛道。所以这一块是非常考验AI的想象力的,要将不合常理的事表现得合理。

提示词:环绕镜头高速掠过,飞船编队从宇航员头顶呼啸而过, 背景巨型城市塔楼层层升起,飞行器在建筑间疾速穿梭。


#点评
赛博世界的运镜表现,豆包Pixeldance的环绕镜头将人排除在了镜头外面,可灵1.5更符合我想要的运镜效果。
豆包Pixeldance ★★★☆☆
可灵1.5 ★★★★★

提示词:车轮快速前进,尘土飞扬,镜头推近聚焦在一个外星人面孔上,外星人的眼睛微微眨动。光线从车内透出,树叶晃动。


#点评
可灵1.5很好的执行了车辆前行和镜头推进的命令,很完美;豆包Pixeldance没有按照提示词行动,不过它有更大的运镜幅度,推到了眼睛的大特写,而且逻辑自洽的是,它表演的像是一个车坏了,然后外星人呆住了的剧情,也算是一个意外的惊喜。
豆包Pixeldance ★★★★☆
可灵1.5 ★★★★★

提示词:镜头推进,一只怪兽咆哮着冲向人群,定格到怪兽的眼睛。


#点评
在一个水墨感很强的中国神话怪兽画面中,两个模型都很好地识别了怪兽的形态和运动方式,豆包Pixeldance的运动幅度更大,直接定格到了怪兽的眼睛,可惜的是最后眼睛穿帮了,有点遗憾。可灵的运镜节奏很好,后面是慢慢推进,很稳但是少了点气势,两边各有优劣。
豆包Pixeldance ★★★★☆
可灵1.5 ★★★★☆
05卡 通 类
卡通风格也是AI视频中非常重要的一个分类,它的画面本身是基于人类的手绘创作,会有更夸张的透视和比例,这是完全有别于写实风格的另一种能力。

提示词:快速前推镜头,聚焦角色面部与伸出的手掌,冷暖光影交织,凌厉目光的战士,黑发随风飞扬,蓝色能量环绕手臂,手掌伸向镜头,蓝色能量涌动,散发细碎光点,昏暗背景中点缀橙色火光与蓝色能量光辉,紧张悬念,能量脉动中暗藏爆发前的压迫感。镜头逐渐拉近至手掌,能量光芒瞬间强化,画面定格于绚丽一刻。


#点评
这两个镜头表现都还可以,这种2.5D画风偏向写实,属于豆包Pixeldance的舒适区,动作变化上我更喜欢豆包Pixeldance的节奏,有快有慢,并且手和脸部还有虚实变焦的镜头语言,可灵1.5相对来说就平淡了些。
豆包Pixeldance ★★★★★
可灵1.5 ★★★★☆

测试图片5-2
提示词:穿着黑色礼服的兔子站在长满青苔的森林地面上,周围是发光的蘑菇。它手持一个铜色浇壶,眼睛专注地盯着蘑菇。兔子开始念动咒语,他把手中的浇水壶放在在地上,浇水壶变成了一个魔法蘑菇,魔法蘑菇开始发出光芒,兔子从蘑菇中抽出一个精美的魔法棒,上面镶嵌着闪亮的宝石。

↑ 豆包Pixeldance

↑ 可灵1.5
#点评
复杂提示词可以用来制作一些魔法之类的特殊视觉效果,豆包Pixeldance的小兔子基本上还原所有的需求动作,特效也很自然,周围的环境也会因为魔法的光线受到影响。可灵1.5并没有展现出对于这段复杂语言的理解,10秒钟的镜头内主体没有做出太多的变化。
豆包Pixeldance ★★★★★
可灵1.5 ★★☆☆☆

提示词:
镜头切换 1:在温馨的厨房中,棕色头发穿格子围裙的卡通小男孩站在摆满牛角面包的桌前,他拿起一个,脸上绽放出笑容。
镜头切换 2:棕色头发穿格子围裙的卡通小男孩拿着牛角面包,来到客厅,将面包递向正在看报纸的白头发卡通爷爷。爷爷放下报纸,接过牛角面包。
镜头切换3:棕色头发穿格子围裙的卡通小男孩站和白头发卡通爷爷开心地吃着牛角面包。
保持人物风格一致,保持人物风格一致,皮克斯风格。


#点评
这是一个多时序的测试场景,使用这种方式有利于保持主体的一致性和场景的连续性。但是这对模型的能力要求会更高一些,在这个画面中,豆包Pixeldance的卡通角色保持了非常好的统一,连新出场的爷爷也是同样的卡通风格,同时,在镜头切换的时候也聪明地使用了不同的景别来丰富故事情节。可灵1.5没有达到多镜头的效果,而且之后的画风变成了真人写实的风格,没有保持好统一性。
豆包Pixeldance ★★★★★
可灵1.5 ★★☆☆☆
06总 结
经过一周的视频测试,我从跑的上百条视频挑选了这16个案例进行对比点评,得出的豆包Pixeldance和可灵1.5最终比分是72:48。由于我测试的主要集中在复杂的提示词这一方面,所以这个结果并不完全代表两款模型整体能力的优劣。
通过这次测试,我发现豆包Pixeldance在环拍镜头,多镜头切换、复杂动画,时序镜头,变焦能力等方面上都有突出的表现。这可能得益于豆包Pixeldance非常优秀的语义理解能力和大幅度的画面运动能力,特别是在10秒的长视频加持下,复杂提示词拥有非常大的潜力和可操作空间。接下来,我会从自己的评价体系中去做一个分析总结: 01
语义理解层面我觉得豆包Pixeldance是要强于可灵1.5的,特别是很多细节的表情和动作,它都能做到与提示词非常接近,这一点对于剧情片来说很重要,而且对于时间更长的10秒钟来说,更好的语义理解意味着它能做出更多的动作和变化。同时,这也是我平时工作当中觉得最重要的一个维度,因为做得好和做得差之间是有一个宽容度的,但是做得出来和做不出来就是天差地别了。02
主体一致性方面
两个模型都表现得非常不错,无论是在人物还是场景方面,它们基本上都能在这一段视频内保持和原图的一致性。值得一提的是,豆包Pixeldance由于拥有更大的运动幅度,比如环绕拍摄时,它能变换出更多的角度;比如多镜头切换时,它能保持主角和画风的一致性,这些都是非常难得的地方。03
运动幅度方面从我的直观感受上来讲,我觉得豆包Pixeldance的运镜幅度更大,更有张力,但动得大了有时候也会出现画面不太稳的问题。可灵1.5不太会远景转特写这种超大幅度的景别变化,它会选择一种更稳妥保守的方案,能在自己的能力范围内把镜头做得漂亮些。04
运镜能力运镜能力我觉得两个模型都是有的,但是从我测试的结果来看,两个模型都还没有做到指哪打哪的程度,很多时候确实是比较看模型的心情和AI模型对画面的理解。如果非要说一个结论的话,我会觉得由于豆包Pixeldance的语义理解更好,所以我们对镜头的控制命令会更有效;而可灵1.5不怎么听命令,但是它的自主运镜通常也不会太差。05
画面质量
可灵1.5出图分辨率是1080p,豆包Pixeldance的出图分为两次,一次是720p,然后可以再进行一次放大,达到2k的分辨率。当然这只是从数值上进行的分析,但是从实际的观感上来看,因为豆包的模型一直都有比较强的锐化和粘稠感,所以可灵1.5的观感效果是要优于豆包Pixeldance。当然目前的豆包Pixeldance已经有了不小的进步了,希望它能再接再厉。06
其他因素
还有一些其他的因素会影响到我们的工作流程,我也需要提一下。除了视频的质量以外,价格也很重要,目前可灵的价格平均下来是3.5元一次,而豆包Pixeldance的是2元一次,所以使用可灵的成本是要高很多的。而且可灵生成的速度比较慢,有的时候高峰期我可能要等十来分钟才能出一条视频,而豆包Pixeldance出视频通常只需要两三分钟,这也是豆包Pixeldance的优势所在。
写到这里,我的主观测评差不多也就结束了,对比这两款国内主流的视频大模型并不是非要分出一个孰优孰劣来,而是要让我们更好的去理解大模型的能力,然后因地制宜的应用到我们的商业案例中去。同时,也能让这些反馈被厂商接收到,做出更好的模型来。
希望中国的大模型能越来越好,中国的AIGC发展更上一层楼!








评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。