
我们推出 Qwen-Image-3.0,Qwen-Image 系列的第三代图像生成基础模型。如果说 Qwen-Image-1.0 的关键词是 “准”,Qwen-Image-2.0 的关键词是 “准 多 齐 美 真”,那么 Qwen-Image-3.0 的核心就是有一个字——“实”。
这个"实"体现在三个维度:
- 内容丰实:支持最大 4.5k token 输入,轻松生成报纸、分镜、试卷等复杂版面。
- 细节真实:支持 10px 小字精准渲染,毛孔、发丝细节生动还原,逼真的微观级刻画。
- 知识厚实:支持 12 国语言原生渲染,主流网页、游戏、直播等界面仿真,丰富的世界知识。
一言以蔽之,Qwen-Image-3.0 不只是在追求"好看",更在追求 “好用” ——让图像生成真正成为可落地的生产力工具。
内容丰实
让我们先从Qwen-Image-3.0生成的下面这张图片开始:
可以看到,Qwen-Image-3.0可以准确的渲染一个数学PPT,包括空间关系、数学符号、定理描述等等这些丰富的视觉内容。这些视觉内容有着合理的排版,相对位置关系,看上去内容丰富。
然而,这并不是Qwen-Image-3.0的真正实力,事实上,这只是Qwen-Image-3.0真实能力的“1/9”,因为这张图事实上只是Qwen-Image-3.0生成的一个复杂9宫格图片中的一个格子。让我们看原图:
没错,上面整张图是Qwen-Image-3.0一次性生成的,而非多个图片拼接而成。这张图片难度在于,每个格子都是一张复杂信息图,如果要精准的描述完整的九宫格,整整需要3.7k个token。
这3.7k token需要完整的刻画隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论 Sylow 定理、银行内控管理信息图、以及细胞 DNA 结构对比——每一格都包含精确的中英文文字、公式、图表和漫画人物等等,
而这,对于Qwen-Image-3.0来说,依然轻松–因为Qwen-Image-3.0 将可接受的指令长度提升至 4.5k token,这意味着模型可以理解和渲染极其复杂、信息密集的视觉版面。
这便是我们提到的"内容丰实"的一个重要特点:内容可横展。横展能力反映了模型语义并置与空间控制的实力——能够让多种概念在同一画面中有序布局、互不干扰地渲染。
除了内容可横展能力以外,纵深能力是内容丰实的另一个重要特征。
横展能力考验的是"在一张画布上摆放多少个并列元素",纵深能力则考验模型的语义解构与逻辑嵌套——能否在一幅图中层层递进地渲染多个嵌套的界面。以下示例用一条指令在一幅图中从外到内依次展示了:VSCode 编程界面 → 千问聊天界面 → 微信聊天界面 → 手冲咖啡海报。每一层都保持了各自 UI 的真实风格与细节,形成了"画中画中画"的视觉纵深。
以上两个例子从"横"和"纵"两个维度诠释了"内容丰实"的内涵。
细节真实
如果说"内容丰实"解决的是"画多少"的问题,那么"细节真实"解决的是"画多细"的问题。Qwen-Image-3.0 在微观细节上的渲染精度达到了新的高度:10px 小字清晰可辨,毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实。首先是小字的精准渲染。
下面是一张关于鲸鲨的知识图解,包含大量的文字和插图。而Qwen-Image-3.0能够准确渲染每个区域。
学术论文是小字渲染的极限测试场——密集的 LaTeX 公式、上下标、希腊字母和定理编号,每一个符号都不能出错。

模型完整渲染了一整页代数几何领域的学术论文,包含多行复杂公式推导。上标、下标、花括号、分数线、多行对齐等 LaTeX 排版元素均准确呈现,小字号下依然保持了极高的可读性。
Qwen-Image-3.0还能生成真实纸张上的细小文字。下面这个例子是Qwen-Image-3.0生成的一个报纸,在这个例子中,模型不仅准确生成了密集的文字,还模拟了报纸的真实效果。
在编辑任务中,我们也可以生成细小的文字。比如下面这个例子,模型生成了具有真实风格的批注。


模型在书页上叠加了逼真的红色手写批注——下划线、波浪线、圈画、箭头和简短评语,字迹自然流畅,完美模拟了高中生课堂笔记的风格。
除了文字与排版的精细还原,”细节真实”在纹理刻画中同样表现突出。下面是两个人像摄影的例子,模型能够刻画非常细腻的纹理。

除人像之外,模型也能刻画其他物体的细腻纹理。.png)
.png)
.png)

在编辑任务中,我们也能生成带有丰富细节的图像。




给定一幅破损或不完整的传统绘画,模型能够修复缺失的部分,同时忠实保持原有的艺术风格和笔触。


模型以与原画一致的笔法完成了鹰搏图的修复,保持了水墨渐变、羽毛质感和构图平衡,同时去除了霉斑和破损痕迹。
知识厚实
“内容丰实"回答了"能画多复杂”,“细节真实"回答了"能画多逼真”,而"知识厚实"回答的是"能画多广"。Qwen-Image-3.0 拥有覆盖 12 国语言、多种字体、100+ 艺术风格和多种 UI 界面的渲染能力,其背后是模型对世界知识的深度理解。
在下面的三个例子中,模型分别准确渲染了日文、韩语和西班牙语。


除了多种语言的准确渲染能力,模型还具有丰富的世界知识。其中,模型能够生成各种仿真的UI界面。

我们也可以结合模型强大的世界知识来制作信息图。在下面的一个例子中,我们基于一个真实图像生成了一个复杂的信息图。


模型在保留原始昆虫照片主体的同时,添加了分类学信息、形态标注、放大细节视图和比例尺等专业元素,生成了一张可以直接用于学术发表的研究配图。
除了以上模型自身具备的世界知识之外,模型还能联网获取最新的世界知识。比如,我们可以要求模型生成一张杭州7月21日的天气预报图。.png)
模型还能找到特定的ip形象并基于此进行创作。比如我们可以生成一张齐白石和梵高在直播间介绍Qwen-Image-3.0的图像。
总结
从 Qwen-Image-1.0 的"准",到 Qwen-Image-2.0 的"准 多 齐 美 真",再到 Qwen-Image-3.0 的"实"——我们一直在追求的目标是:让图像生成从"能用"走向"实用",从"好看"走向"好用"。
Qwen-Image-3.0 以"内容丰实、细节真实、知识厚实"三大特色为支撑,在报纸 PDF、短剧分镜、复杂 UI 界面等高价值生产力场景中取得了显著突破。我们相信,随着图像生成模型能力的持续提升,它将在设计、内容创作、教育、电商等更多领域中释放出真正的生产力价值。
以上就是本次更新的主要内容,祝大家使用 Qwen-Image-3.0 愉快!
使用地址: https://chat.qwen.ai/










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。