2026年8月5日,阿里巴巴千问图像生成模型 Qwen-Image-3.0正式上线千问AI平台,并面向用户开放在线体验与API服务。

此次上线包含两个版本:

  • qwen-image-3.0-pro:旗舰版本,重点处理复杂版式、小字、多语言文字及高质量商业视觉
  • qwen-image-3.0:标准版本,在画面质量、生成速度和调用成本之间取得平衡

标准版文生图价格为 0.18元一张,Pro版1K图片为0.25元一张,2K图片为0.5元一张。海外开发者还可以通过Qwen Cloud接入相关服务。

Arena.ai最新Text-to-Image真人盲测榜单中,qwen-image-3.0-pro以1263±11分暂列全球第五,并成为当前排名最高的中国图像生成模型。该成绩目前仍标记为Preliminary,排名会随着新增投票继续变化。

image.png

Qwen-Image-3.0是什么?

Qwen-Image-3.0是千问图像模型系列的第三代基础图像生成模型。

与只擅长生成写真人像、插画或风景的传统生图模型相比,Qwen-Image-3.0更加关注“信息与画面同时正确”,重点提升了以下能力:

  • 长指令理解
  • 复杂图文版式
  • 中文及多语言文字渲染
  • 小字号文字生成
  • 信息图和知识图解
  • 多层UI界面
  • 数学公式与科研图表
  • 多图参考与图片编辑
  • 写实人物、材质及场景细节
  • 商业设计中的信息对应关系

千问团队将这一代模型的特点概括为:

  • Rich Content:丰富内容
  • Authentic Details:真实细节
  • Deep Knowledge:深度知识

模型不再只追求“第一眼好看”,而是尝试生成可以直接用于海报、报告、界面、信息图和营销素材的结构化视觉内容。

两个版本有什么区别?

对比项目Qwen-Image-3.0Qwen-Image-3.0-Pro
模型IDqwen-image-3.0qwen-image-3.0-pro
产品定位标准版,平衡速度、质量与价格旗舰版,强调复杂内容和精细渲染
文生图支持支持
图片编辑支持支持
最大参考图片3张3张
单次最大输出6张6张
最大输出分辨率2048×20482048×2048
1K输出价格0.18元/张0.25元/张
2K输出价格0.18元/张0.5元/张
主要场景批量素材、内容运营、电商设计复杂海报、长文字、信息图、UI设计

阿里云文档将标准版描述为“平衡质量与速度”,Pro版则重点面向复杂版面、小字渲染和多语言字体等高难度任务。

0.18元一张具体指哪个版本?

“0.18元一张”对应的是标准版:

qwen-image-3.0

标准版当前的输出价格为:

输出档位输出价格
1K0.18元/张
2K0.18元/张

Pro版价格为:

输出档位输出价格
1K0.25元/张
2K0.5元/张

文生图没有输入图片,因此不产生图片输入费用。

使用图生图或图片编辑时,每张输入图片还会收取0.02元。模型最多支持输入3张参考图片,因此一次三图编辑会额外产生0.06元输入成本。

例如,使用标准版输入3张参考图片,再生成一张2K结果:

输入图片:3 × 0.02元 = 0.06元
输出图片:1 × 0.18元 = 0.18元
合计:0.24元

使用Pro版完成相同的三图参考2K任务:

输入图片:3 × 0.02元 = 0.06元
2K输出:1 × 0.5元 = 0.5元
合计:0.56元

实际账单应以接口返回的input_image_typeoutput_image_type字段为准。

1K和2K如何划分?

Qwen-Image-3.0系列根据输出图片的总像素面积划分计费档位:

  • 总像素面积不超过2,250,000:按照1K档位
  • 总像素面积超过2,250,000:按照2K档位

API支持的输出像素面积范围约为:

512×512 至 2048×2048

支持的画面比例范围为:

1:8 至 8:1

因此,模型不仅可以生成常见的1:1、3:4、4:3和16:9画面,也支持较长的横幅、竖幅海报及特殊比例内容。

需要注意,Qwen-Image-3.0当前最高输出为2048×2048,不是4K模型。需要4096×4096文生图时,阿里云目前推荐使用wan2.7-image-pro

最长支持4.5K Token复杂指令

Qwen-Image-3.0系列的一项核心升级,是支持最长约 4.5K Token的复杂指令输入。

这并不只是让用户写更长的摄影提示词,而是允许在一个请求中同时描述:

  • 完整文案
  • 多级标题
  • 页面布局
  • 每个模块的位置
  • 元素之间的对应关系
  • 图表数据
  • 数学公式
  • 角色和场景设定
  • 字体及颜色要求
  • 哪些内容必须保留
  • 哪些内容禁止出现

阿里云官方文档将4.5K Token输入列为Qwen-Image-3.0-Pro处理复杂内容、真实摄影质感和密集信息排版的重要能力。

例如,用户可以一次提交一份完整活动海报Brief:

生成一张3:4竖版人工智能设计大会海报。

顶部放置主标题“AI设计新视界”,使用高对比无衬线字体;
副标题为“2026全球智能创作峰会”。

画面中部展示未来城市、设计工作台和悬浮的AI界面;
下方设置三个信息模块:
1. AI视觉设计
2. 智能工作流
3. 多模态创作

底部准确显示:
2026年8月20日
深圳国际会展中心
主办方:UIED设计社区

整体使用白色、银灰和电光蓝配色,
保留充足留白,不要额外生成无意义英文。

过去,这类任务往往需要先生成背景,再进入设计软件添加文字和模块。

Qwen-Image-3.0的目标,是在一次生成中同时处理内容、布局和视觉风格。

可以生成3×3高密度信息图

官方发布案例展示了模型一次生成3×3信息网格、报纸版面、研究页面和多模块UI界面的能力。

这类任务不仅要求模型生成多个区域,还要正确处理:

  • 九个模块之间的顺序
  • 每个模块对应的文案
  • 标题与说明文字层级
  • 图标与内容的匹配
  • 模块间距和视觉统一
  • 信息阅读路线
  • 整体版面密度

适合的商业场景包括:

  • 产品功能九宫格
  • 小红书知识卡片
  • 电商卖点图
  • 教学信息图
  • 数据报告
  • 时间轴
  • 产品使用指南
  • 社交媒体长图
  • 品牌服务介绍
  • 流程及步骤说明

不过,模块数量越多,文字和对应关系出错的概率也越高。正式发布前仍应逐项检查。

支持12国语言原生文字渲染

Qwen-Image-3.0支持12种语言的原生文字渲染,并覆盖多种字体类型。模型可以在一张图片中生成中文、英文及其他语言内容,用于多语言海报、包装、界面和跨境营销素材。

“原生渲染”意味着文字不是在生成图片后由另一个排版模块简单覆盖,而是作为画面中的组成部分,与以下视觉元素共同生成:

  • 纸张
  • 金属
  • 玻璃
  • 布料
  • 包装盒
  • 招牌
  • 屏幕
  • 墙面
  • 书籍及报纸

例如,模型可以尝试生成:

  • 印在玻璃瓶上的品牌名称
  • 织在衣服上的文字
  • 发光屏幕中的UI标签
  • 墙面上的活动海报
  • 报纸及杂志中的多栏正文
  • 产品包装上的中英文说明

文字与材质融合,比后期简单叠字更自然,但也更难保证每个字符完全正确。

最小可渲染约10像素文字

千问团队还展示了约10像素小文字的生成能力。

这对以下场景具有实际价值:

  • 报纸正文
  • 信息图注释
  • 图表刻度
  • UI按钮文字
  • 商品包装说明
  • 学术图表
  • 地图标注
  • 多栏排版

需要注意,“能够渲染10像素文字”不等于所有10像素文字都能保持100%准确。

当画面同时包含长段落、复杂字体、多种语言或大量数字时,仍可能出现:

  • 错字
  • 漏字
  • 重复文字
  • 标点错误
  • 数字变化
  • 字体不一致
  • 行距和对齐问题

正式商业图片仍需要人工校对,尤其是价格、日期、联系方式、品牌名称及法律声明。

覆盖100多种艺术风格

Qwen-Image-3.0官方展示的风格覆盖超过100种,既包括传统艺术媒介,也包含现代数字设计和商业视觉。

可覆盖的主要方向包括:

  • 写实摄影
  • 电影画面
  • 时尚摄影
  • 商业产品摄影
  • 油画
  • 水彩
  • 素描
  • 水墨
  • 版画
  • 像素艺术
  • 3D渲染
  • 扁平矢量插画
  • 动漫
  • 漫画
  • 复古印刷
  • 赛博朋克
  • 极简主义
  • 拼贴设计
  • 信息图
  • UI及游戏界面

“100多种风格”更多代表模型的风格覆盖范围,并不表示每一种风格都拥有完全相同的稳定性。

实际使用时,应结合:

  • 风格名称
  • 材质
  • 光线
  • 构图
  • 色彩
  • 镜头
  • 参考图片
  • 禁止元素

共同约束生成方向。

UI界面生成能力进一步提升

Qwen-Image-3.0可以生成多种界面类视觉,包括:

  • 网页
  • 手机App
  • 游戏HUD
  • 直播界面
  • 数据看板
  • 开发工具
  • 操作系统窗口
  • 产品控制台

官方介绍将多种UI界面列入模型的重点渲染能力。

相比普通图片生成,UI界面要求模型理解:

  • 页面栅格
  • 导航和侧边栏
  • 按钮状态
  • 卡片层级
  • 图表区域
  • 表单输入框
  • 标签和图标
  • 文字与控件对应关系

这类能力适合产品经理和设计师快速生成视觉原型。

但生成结果仍然是PNG图片,不是可以直接交付的Figma文件或前端代码。正式开发仍需重新建立组件、交互和响应式布局。

可以处理数学公式和专业知识图像

Qwen-Image-3.0的“Deep Knowledge”能力,主要体现在把专业内容转化为结构化视觉,而不只是生成抽象艺术图片。

模型可以尝试处理:

  • 数学公式
  • 几何图形
  • 科学示意图
  • 教学图解
  • 历史及知识卡片
  • 数据图表
  • 论文页面
  • 复杂流程图

官方案例显示,模型可以将公式、正文、图表和手写标注放在同一张学术页面中。

不过,图像模型不应被视为专业知识数据库。

模型可能生成外观合理、但事实或公式错误的内容。涉及以下场景时,必须由专业人员核对:

  • 数学推导
  • 医学结构
  • 法律流程
  • 金融数据
  • 历史时间
  • 实验步骤
  • 产品技术参数

文生图与图片编辑使用同一个模型

Qwen-Image-3.0和Pro版本均同时支持:

  • Text-to-Image:文字生成图片
  • Image-to-Image:图片生成图片
  • Image Editing:图片编辑

开发者不需要在文生图和编辑时切换两个模型ID。

图片编辑可以用于:

  • 修改文字
  • 替换背景
  • 添加或删除物体
  • 改变人物动作
  • 转换视觉风格
  • 调整画面布局
  • 修复图片
  • 组合多张参考素材

用户最多可以上传3张参考图片,再通过文字说明每张图片的用途。

例如:

参考图片1中的人物五官;
参考图片2中的服装;
参考图片3中的海报构图;
生成一张3:4新品发布海报,
保持人物身份和服装细节,
将背景改成银灰色未来实验室。

API支持JPG、JPEG、PNG、BMP、TIFF、WEBP和GIF等输入格式,单张图片最大10MB。

单次最多生成6张图片

Qwen-Image-3.0系列支持通过参数n设置单次输出数量:

1至6张

用户可以一次生成多个方案,用于比较:

  • 不同构图
  • 不同风格
  • 不同镜头
  • 不同排版
  • 不同人物表现
  • 不同商品场景

需要注意,计费按照实际生成的图片张数计算。

例如,标准版一次生成6张图片:

6 × 0.18元 = 1.08元

Pro版一次生成6张2K图片:

6 × 0.5元 = 3元

批量生产时,应限制无意义的重复生成,并保存种子、提示词和最终选中的版本。

支持两种Prompt智能改写

API默认开启提示词智能改写,并提供两种模式:

Direct Prompt Enhancement

参数值:

direct

适合大多数文生图和图片编辑任务。

它会在不明显改变用户目标的前提下,补充画面风格、构图、光线和细节。

Agent Prompt Enhancement

参数值:

agent

适合复杂文生图任务。

Agent模式会对需求进行更完整的分析和整理,适合信息图、商业海报、UI界面和多模块视觉。

目前Agent Prompt Enhancement只支持文生图,不支持图生图或图片编辑。

对于已经写得非常详细的专业提示词,也可以关闭prompt_extend,避免系统重新解释原始要求。

支持负向提示词和固定Seed

Qwen-Image-3.0 API提供:

  • negative_prompt
  • seed
  • watermark
  • size
  • n
  • prompt_extend

等控制参数。

负向提示词可以描述不希望出现的内容,例如:

不要水印,不要无意义文字,不要多余人物,
不要改变商品颜色,不要错误Logo。

固定Seed有助于让多次生成保持相对接近的初始随机状态,但并不能保证不同模型版本或不同时间的结果完全一致。

API默认不添加水印,开发者可以根据自身应用场景决定是否开启。

Arena文生图榜国内第一

截至2026年8月5日,Arena.ai Text-to-Image Arena显示:

排名模型得分状态
5Qwen-Image-3.0-Pro1263±11Preliminary
6Gemini 3.1 Flash Image1262±5正式统计
7Seedream 5.0 Pro1257±5正式统计

Qwen-Image-3.0-Pro目前是榜单中排名最高的中国模型。

但需要注意:

  • 当前只累计约2801次投票
  • 榜单仍标记为Preliminary
  • 分数会随新增投票发生变化
  • 一分左右的差距不代表稳定领先
  • 真人偏好榜无法覆盖所有专业场景

因此,“文生图国内第一”有当前榜单支持,但不能写成永久排名或所有能力全面第一。

Qwen-Image-3.0适合哪些商业场景?

品牌与广告设计

可以根据完整Brief生成包含品牌文案、产品、卖点和活动信息的海报初稿。

电商视觉

适合生成:

  • 商品场景图
  • 活动主图
  • 卖点信息图
  • 商品海报
  • 社交媒体广告
  • 海外多语言素材

新媒体内容

可以制作:

  • 小红书封面
  • 公众号头图
  • 微博配图
  • 知识卡片
  • 九宫格图文
  • AI资讯海报

UI与产品设计

可用于快速生成网页、App、数据看板及游戏界面的概念图。

教育和知识内容

可以将知识点、公式、流程和时间线转化为信息图或教学海报。

跨境营销

12国语言文字渲染能力适合不同市场的本地化广告、包装和社交媒体素材。

企业批量工作流

标准版0.18元一张的价格,适合接入批量营销素材、内容运营和自动化设计流程。

Standard版和Pro版应该怎么选?

选择Standard版

适合:

  • 预算敏感
  • 大批量生成
  • 社交媒体配图
  • 普通产品场景
  • 内容创作
  • 初期方案探索
  • 对小字精度要求不极端

模型ID:

qwen-image-3.0

选择Pro版

适合:

  • 长文字海报
  • 复杂信息图
  • 多语言排版
  • UI界面
  • 高密度知识内容
  • 精细商品与人物
  • 正式商业方案初稿

模型ID:

qwen-image-3.0-pro

可以先使用标准版进行低成本构图探索,选定方向后再用Pro版生成最终候选方案。

API调用时需要注意什么?

图片链接只保留24小时

API返回的生成图片URL有效期为24小时。开发者需要及时下载并保存到自己的对象存储。

北京和新加坡使用不同API Key

中国北京地域和新加坡地域使用不同的API Key与请求地址,不能混用。

正式文字仍需人工校对

模型文字能力很强,但不能保证价格、日期、品牌名和长段落绝对正确。

API开放不等于开放权重

截至8月5日,官方此次明确开放的是在线体验和API服务。公开资料暂未给出Qwen-Image-3.0模型权重、参数规模及完整技术报告,因此目前应将其视为托管式商业模型,而不是已经可以本地部署的开放权重模型。

生成知识图时需要核查事实

图像中的公式、数据、地图和科学结构可能看起来合理,但内容仍可能错误。

商业素材要检查版权

参考图片、字体、人物肖像、品牌Logo及商品素材,需要确认拥有相应使用权。

总结

Qwen-Image-3.0已经于2026年8月5日正式上线千问AI平台,并开放标准版和Pro版API。

标准版qwen-image-3.0的文生图价格为0.18元一张,1K和2K输出采用相同价格;Pro版qwen-image-3.0-pro则分别为1K 0.25元、2K 0.5元。

模型系列支持:

  • 最长约4.5K Token复杂指令
  • 12国语言文字渲染
  • 100多种艺术风格
  • 约10像素小文字
  • 复杂信息图和图文版面
  • UI及游戏界面
  • 文生图和图片编辑
  • 最多3张参考图片
  • 单次最多6张输出
  • 最高2048×2048分辨率
  • Agent Prompt Enhancement

Arena.ai最新文生图真人盲测中,Qwen-Image-3.0-Pro暂列全球第五,并成为当前排名最高的中国模型,但成绩仍处于初步统计阶段。

Qwen-Image-3.0最值得关注的地方,不只是图片更写实,而是它开始处理过去必须由设计师在多个软件中完成的复杂任务:

把长文案、数据、公式、布局、图片和视觉风格放入同一个指令,再直接生成一份结构相对完整的视觉成果。

对于自媒体、电商、跨境营销、UI设计和企业内容团队而言,0.18元一张的标准版API,也进一步降低了将高信息密度图像生成接入商业工作流的成本。

不过,正式商用前仍需人工检查文字、事实、商品细节、品牌规范及版权。API全量上线也不等于模型权重已经开放,本地部署仍需等待后续官方消息。

相关链接