就在昨天,Google更新了开放Gemini 2.0 Flash的原生图像生成功能。该模型确实实现了多模态输入与自然语言理解的整合,用户可通过对话逐步优化图像,例如在漫画分镜制作中保持角色一致性,根据官方描述,其独特优势在于融合世界知识生成符合逻辑的视觉内容,如菜谱插图中准确呈现食材与烹饪流程。

现在的Gemini2.0-Flash自身具备的超强推理能力,能结合现实世界的知识生成更符合上下文的图像,理解更多细节,更遵循文化背景特征。

虽然官方宣称"对话式PS"革新工作流,但测试下来实际需经历3-5轮对话调整才可能达到可用效果。目前生成的效果堪比两年前StableDiffusion的基础模型1.5和2.0的效果,测试替换人物头发颜色、衣服等都缺失纹理光影的真实感,甚至就是一张贴纸的质感,离宣传的效果还有很大差距,离真正的言出法随还有一段时间。

感兴趣的朋友可以亲测一下,注意需要魔法飞行