自从2月份Stability AI公布了他们的stable diffusion3之后,AI圈子的人都被瞬间打上了鸡血,无不满怀期待。
图片
原因很简单,目前的sd虽然在开源这一领域拥有无可比拟的优势,但是相比于mj艺术家一般的审美,和dalle语言大师一般的理解能力,SD的文字出图总是会让人有一种让人使不上劲的感觉。虽然它拥有controlnet这样的大杀器,但是使用门槛还是太高了。一个好的AI产品最重要的是应用,是要让普通人也能轻松的上手,所以我们也一直期待着sd下一代产品的来临。
但是前段时间Stability AI又突生变故,核心研究团队的关键成员从Stability AI辞职。至于其中的利益纠葛我们就不做猜想了,但是sd的新产品还能不能正常发布让大家期待的心又悬了起来。

前情提要讲完了,今天的重磅消息是,Stable Diffusion3的api接口正式开放,我们今天就怀着期待和疑惑的心情来看一看这个新模型的表现如何。

#01

申请

这里是体验网址:https://huggingface.co/spaces/latentcat/sd3-api

我们打开网页之后,先点击下面的链接去申请一个API Key。

然后会弹出一个账号登录的界面,大家可以用任意的邮箱去申请一个stability.ai的账号,然后登录即可。
登录之后可以看到有一个API key,我们点击按钮复制这个key。
然后将API key粘贴在这里,就可以开始使用了。
目前可以调整的参数非常简单,分为:正向提示词、出图比例、模型选择、种子值和负向提示词。
这里要注意的是每个key只能4张图片,出完之后就会一直出错了除非你充值进去。SD3积分是10美金1000个积分,SD3一次消耗6.5个积分,算下来就是5毛钱一张图。

#02

测试

首先,我想测试一下sd3对语义理解的简洁程度,因为以往我们用sd需要写一大堆质量提示词,很繁琐,不符合普通人的交流习惯。
所以第一张图,我写道“一直穿着白T恤的兔子在海面上冲浪,T恤上写着‘SD3’”,没有附加任何质量提示词,也没有写负面提示词。
出图结果如下,从语义理解的角度来看,所有的信息全对,先给一个好评,但是从审美的角度出发,虽然图片的真实度很强,但是还是没有达到mj对美学的理解程度。
同样的提示词,我放到mj中去生成一下,高下立判。
我想了想,可能还是从提示词的角度出发去找找问题,毕竟这是sd啊,sd的传统就是要写一大堆词的啊。所以我调整了思路,加了一大堆质量提示词,并补齐了负向提示词。
正向:32k ultra HD photos, high detail, rendered in Pixar's signature style, vibrant colors, laugh filled atmosphere, Pixar style, visually stunning and emotionally appealing,The rabbit, who has been wearing a white T-shirt with the word 'SD3' on it, surfs the sea.
负向:(worst quality, low quality, normal quality, lowres, low details, oversaturated, undersaturated, overexposed, underexposed, grayscale, bw, bad photo, bad photography, bad art:1.4), (blur, blurry, grainy), morbid, ugly, asymmetrical, mutated malformed, mutilated, poorly lit, bad shadow, draft, cropped, out of frame, cut off, censored, jpeg artifacts, out of focus, glitch, duplicate,
各种提示词都补全之后,出图的效果确实好了不少,看来SD的祖传艺能还是不能丢。
同样的词,我又在DALLE中跑了一下,只能说一句,大哥你是真的很抽象。。。
来一张直观的对比图吧,大家自行判断。
再做个什么测试呢?我想到了最近在参加的“VideoBattle生成挑战赛”,每期会有一个特定的主题,大家可以围绕这个主题去用AI生成一段4秒的视频,是一个比拼创意的开脑洞的好机会。
这一期的主题是“眼睛”,我们要围绕这幅图来进行创作。我想了一个主题是谈论人和AI之间的界限在哪里,就像是未来有一天,当全知全能的AI拥有了真实情感之后,它是不是就突破了和人类最后的隔阂,变成了一个真正的人。
所以,我想到一个画面就是聚焦在一个人工智能的眼睛上,它流下了一滴泪,代表着它拥有了情感,然后它的眼睛就变成人的眼睛。
就是这一幅机器人流泪的表情,我在MJ和DALLE中抽卡抽了很久,一直没有抽到符合心意的图片,直到最后才在sd的配合下拼出了这张图。这个视频的呈现我放在文章的最后,现在呢我想用SD3来试试,看它能不能读懂我的需求。
由于我还剩两次免费白嫖的机会,所以我谨慎地写出了第一段提示词:32k超高清照片,高细节,以皮克斯的标志性风格渲染,充满活力的色彩,皮克斯风格,视觉震撼,情感感染,卡通机器人的眼睛特写,悲伤的泪水从眼角流下。
出图!

居然是一个人的脸,虽然我写了主角是卡通机器人,但它出来的只有机械铠甲。

看来我还有最后一次机会,为了让机械感更强,更能体现AI一点,我直接祭出了变形金刚,去掉了皮克斯风格。

提示词如下:32k超高清照片,高细节,视觉震撼,情感感染,一只变形金刚风格的机器人的眼睛的特写,有一颗泪水从眼角滑落。

出图!

很好,我觉得是一个非常精准的表达,虽然样本量很小,但是就这几张图而言,SD3的语义理解达到了让我满意的标准,可能是一个画质进阶版的DALLE。
来看一下三位大哥的对比,mj的图好看是好看,但总让我感觉是一个戴着机械头盔的人,它没有完全理解我的意思,而且眼泪变成了雨水;DALLE语义理解确实很精准,但是图又难看了点,作为科普配图还行,艺术表达的话差了点。相比起来,这一次感觉是SD3赢了。
毕竟,能精确达到甲方需求的AI 才是好AI。

好了,我的额度用完了,虽然测试才刚刚开始,但是充钱是肯定不会充钱的~~剩下的测试交给你们了,等你们的反馈哦。

#03

官方效果

接下来,我们看看官方的出图吧。

总结一下,SD3的效果相比于以前的sd1.5和sdxl是更好的,语义理解是更强大的,但是目前由于之前Stability AI公司的人事变动,SD3继续开源的可能性微乎其微,再加上目前的收费政策,未来还能不能看到像sd1.5那样百花齐放的微调大模型盛况,我们只能保持怀疑了。

最后的最后的video battle参赛的作品——智能之心”。

最终我还是选择了SD,可能对于这个主题而言,我需要的不是炫酷的画面,而是对情节的精准表达。

当有一天,AI拥有了情感,它会成为真正的人吗?
-END-