2026年8月5日,阿里巴巴千问图像生成模型 Qwen-Image-3.0正式上线千问AI平台,并面向用户开放在线体验与API服务。
此次上线包含两个版本:
qwen-image-3.0-pro:旗舰版本,重点处理复杂版式、小字、多语言文字及高质量商业视觉qwen-image-3.0:标准版本,在画面质量、生成速度和调用成本之间取得平衡
标准版文生图价格为 0.18元一张,Pro版1K图片为0.25元一张,2K图片为0.5元一张。海外开发者还可以通过Qwen Cloud接入相关服务。
在Arena.ai最新Text-to-Image真人盲测榜单中,qwen-image-3.0-pro以1263±11分暂列全球第五,并成为当前排名最高的中国图像生成模型。该成绩目前仍标记为Preliminary,排名会随着新增投票继续变化。

Qwen-Image-3.0是什么?
Qwen-Image-3.0是千问图像模型系列的第三代基础图像生成模型。
与只擅长生成写真人像、插画或风景的传统生图模型相比,Qwen-Image-3.0更加关注“信息与画面同时正确”,重点提升了以下能力:
- 长指令理解
- 复杂图文版式
- 中文及多语言文字渲染
- 小字号文字生成
- 信息图和知识图解
- 多层UI界面
- 数学公式与科研图表
- 多图参考与图片编辑
- 写实人物、材质及场景细节
- 商业设计中的信息对应关系
千问团队将这一代模型的特点概括为:
- Rich Content:丰富内容
- Authentic Details:真实细节
- Deep Knowledge:深度知识
模型不再只追求“第一眼好看”,而是尝试生成可以直接用于海报、报告、界面、信息图和营销素材的结构化视觉内容。
两个版本有什么区别?
| 对比项目 | Qwen-Image-3.0 | Qwen-Image-3.0-Pro |
|---|---|---|
| 模型ID | qwen-image-3.0 | qwen-image-3.0-pro |
| 产品定位 | 标准版,平衡速度、质量与价格 | 旗舰版,强调复杂内容和精细渲染 |
| 文生图 | 支持 | 支持 |
| 图片编辑 | 支持 | 支持 |
| 最大参考图片 | 3张 | 3张 |
| 单次最大输出 | 6张 | 6张 |
| 最大输出分辨率 | 2048×2048 | 2048×2048 |
| 1K输出价格 | 0.18元/张 | 0.25元/张 |
| 2K输出价格 | 0.18元/张 | 0.5元/张 |
| 主要场景 | 批量素材、内容运营、电商设计 | 复杂海报、长文字、信息图、UI设计 |
阿里云文档将标准版描述为“平衡质量与速度”,Pro版则重点面向复杂版面、小字渲染和多语言字体等高难度任务。
0.18元一张具体指哪个版本?
“0.18元一张”对应的是标准版:
qwen-image-3.0标准版当前的输出价格为:
| 输出档位 | 输出价格 |
| 1K | 0.18元/张 |
| 2K | 0.18元/张 |
Pro版价格为:
| 输出档位 | 输出价格 |
| 1K | 0.25元/张 |
| 2K | 0.5元/张 |
文生图没有输入图片,因此不产生图片输入费用。
使用图生图或图片编辑时,每张输入图片还会收取0.02元。模型最多支持输入3张参考图片,因此一次三图编辑会额外产生0.06元输入成本。
例如,使用标准版输入3张参考图片,再生成一张2K结果:
输入图片:3 × 0.02元 = 0.06元
输出图片:1 × 0.18元 = 0.18元
合计:0.24元使用Pro版完成相同的三图参考2K任务:
输入图片:3 × 0.02元 = 0.06元
2K输出:1 × 0.5元 = 0.5元
合计:0.56元实际账单应以接口返回的input_image_type和output_image_type字段为准。
1K和2K如何划分?
Qwen-Image-3.0系列根据输出图片的总像素面积划分计费档位:
- 总像素面积不超过2,250,000:按照1K档位
- 总像素面积超过2,250,000:按照2K档位
API支持的输出像素面积范围约为:
512×512 至 2048×2048支持的画面比例范围为:
1:8 至 8:1因此,模型不仅可以生成常见的1:1、3:4、4:3和16:9画面,也支持较长的横幅、竖幅海报及特殊比例内容。
需要注意,Qwen-Image-3.0当前最高输出为2048×2048,不是4K模型。需要4096×4096文生图时,阿里云目前推荐使用wan2.7-image-pro。
最长支持4.5K Token复杂指令
Qwen-Image-3.0系列的一项核心升级,是支持最长约 4.5K Token的复杂指令输入。
这并不只是让用户写更长的摄影提示词,而是允许在一个请求中同时描述:
- 完整文案
- 多级标题
- 页面布局
- 每个模块的位置
- 元素之间的对应关系
- 图表数据
- 数学公式
- 角色和场景设定
- 字体及颜色要求
- 哪些内容必须保留
- 哪些内容禁止出现
阿里云官方文档将4.5K Token输入列为Qwen-Image-3.0-Pro处理复杂内容、真实摄影质感和密集信息排版的重要能力。
例如,用户可以一次提交一份完整活动海报Brief:
生成一张3:4竖版人工智能设计大会海报。
顶部放置主标题“AI设计新视界”,使用高对比无衬线字体;
副标题为“2026全球智能创作峰会”。
画面中部展示未来城市、设计工作台和悬浮的AI界面;
下方设置三个信息模块:
1. AI视觉设计
2. 智能工作流
3. 多模态创作
底部准确显示:
2026年8月20日
深圳国际会展中心
主办方:UIED设计社区
整体使用白色、银灰和电光蓝配色,
保留充足留白,不要额外生成无意义英文。过去,这类任务往往需要先生成背景,再进入设计软件添加文字和模块。
Qwen-Image-3.0的目标,是在一次生成中同时处理内容、布局和视觉风格。
可以生成3×3高密度信息图
官方发布案例展示了模型一次生成3×3信息网格、报纸版面、研究页面和多模块UI界面的能力。
这类任务不仅要求模型生成多个区域,还要正确处理:
- 九个模块之间的顺序
- 每个模块对应的文案
- 标题与说明文字层级
- 图标与内容的匹配
- 模块间距和视觉统一
- 信息阅读路线
- 整体版面密度
适合的商业场景包括:
- 产品功能九宫格
- 小红书知识卡片
- 电商卖点图
- 教学信息图
- 数据报告
- 时间轴
- 产品使用指南
- 社交媒体长图
- 品牌服务介绍
- 流程及步骤说明
不过,模块数量越多,文字和对应关系出错的概率也越高。正式发布前仍应逐项检查。
支持12国语言原生文字渲染
Qwen-Image-3.0支持12种语言的原生文字渲染,并覆盖多种字体类型。模型可以在一张图片中生成中文、英文及其他语言内容,用于多语言海报、包装、界面和跨境营销素材。
“原生渲染”意味着文字不是在生成图片后由另一个排版模块简单覆盖,而是作为画面中的组成部分,与以下视觉元素共同生成:
- 纸张
- 金属
- 玻璃
- 布料
- 包装盒
- 招牌
- 屏幕
- 墙面
- 书籍及报纸
例如,模型可以尝试生成:
- 印在玻璃瓶上的品牌名称
- 织在衣服上的文字
- 发光屏幕中的UI标签
- 墙面上的活动海报
- 报纸及杂志中的多栏正文
- 产品包装上的中英文说明
文字与材质融合,比后期简单叠字更自然,但也更难保证每个字符完全正确。
最小可渲染约10像素文字
千问团队还展示了约10像素小文字的生成能力。
这对以下场景具有实际价值:
- 报纸正文
- 信息图注释
- 图表刻度
- UI按钮文字
- 商品包装说明
- 学术图表
- 地图标注
- 多栏排版
需要注意,“能够渲染10像素文字”不等于所有10像素文字都能保持100%准确。
当画面同时包含长段落、复杂字体、多种语言或大量数字时,仍可能出现:
- 错字
- 漏字
- 重复文字
- 标点错误
- 数字变化
- 字体不一致
- 行距和对齐问题
正式商业图片仍需要人工校对,尤其是价格、日期、联系方式、品牌名称及法律声明。
覆盖100多种艺术风格
Qwen-Image-3.0官方展示的风格覆盖超过100种,既包括传统艺术媒介,也包含现代数字设计和商业视觉。
可覆盖的主要方向包括:
- 写实摄影
- 电影画面
- 时尚摄影
- 商业产品摄影
- 油画
- 水彩
- 素描
- 水墨
- 版画
- 像素艺术
- 3D渲染
- 扁平矢量插画
- 动漫
- 漫画
- 复古印刷
- 赛博朋克
- 极简主义
- 拼贴设计
- 信息图
- UI及游戏界面
“100多种风格”更多代表模型的风格覆盖范围,并不表示每一种风格都拥有完全相同的稳定性。
实际使用时,应结合:
- 风格名称
- 材质
- 光线
- 构图
- 色彩
- 镜头
- 参考图片
- 禁止元素
共同约束生成方向。
UI界面生成能力进一步提升
Qwen-Image-3.0可以生成多种界面类视觉,包括:
- 网页
- 手机App
- 游戏HUD
- 直播界面
- 数据看板
- 开发工具
- 操作系统窗口
- 产品控制台
官方介绍将多种UI界面列入模型的重点渲染能力。
相比普通图片生成,UI界面要求模型理解:
- 页面栅格
- 导航和侧边栏
- 按钮状态
- 卡片层级
- 图表区域
- 表单输入框
- 标签和图标
- 文字与控件对应关系
这类能力适合产品经理和设计师快速生成视觉原型。
但生成结果仍然是PNG图片,不是可以直接交付的Figma文件或前端代码。正式开发仍需重新建立组件、交互和响应式布局。
可以处理数学公式和专业知识图像
Qwen-Image-3.0的“Deep Knowledge”能力,主要体现在把专业内容转化为结构化视觉,而不只是生成抽象艺术图片。
模型可以尝试处理:
- 数学公式
- 几何图形
- 科学示意图
- 教学图解
- 历史及知识卡片
- 数据图表
- 论文页面
- 复杂流程图
官方案例显示,模型可以将公式、正文、图表和手写标注放在同一张学术页面中。
不过,图像模型不应被视为专业知识数据库。
模型可能生成外观合理、但事实或公式错误的内容。涉及以下场景时,必须由专业人员核对:
- 数学推导
- 医学结构
- 法律流程
- 金融数据
- 历史时间
- 实验步骤
- 产品技术参数
文生图与图片编辑使用同一个模型
Qwen-Image-3.0和Pro版本均同时支持:
- Text-to-Image:文字生成图片
- Image-to-Image:图片生成图片
- Image Editing:图片编辑
开发者不需要在文生图和编辑时切换两个模型ID。
图片编辑可以用于:
- 修改文字
- 替换背景
- 添加或删除物体
- 改变人物动作
- 转换视觉风格
- 调整画面布局
- 修复图片
- 组合多张参考素材
用户最多可以上传3张参考图片,再通过文字说明每张图片的用途。
例如:
参考图片1中的人物五官;
参考图片2中的服装;
参考图片3中的海报构图;
生成一张3:4新品发布海报,
保持人物身份和服装细节,
将背景改成银灰色未来实验室。API支持JPG、JPEG、PNG、BMP、TIFF、WEBP和GIF等输入格式,单张图片最大10MB。
单次最多生成6张图片
Qwen-Image-3.0系列支持通过参数n设置单次输出数量:
1至6张用户可以一次生成多个方案,用于比较:
- 不同构图
- 不同风格
- 不同镜头
- 不同排版
- 不同人物表现
- 不同商品场景
需要注意,计费按照实际生成的图片张数计算。
例如,标准版一次生成6张图片:
6 × 0.18元 = 1.08元Pro版一次生成6张2K图片:
6 × 0.5元 = 3元批量生产时,应限制无意义的重复生成,并保存种子、提示词和最终选中的版本。
支持两种Prompt智能改写
API默认开启提示词智能改写,并提供两种模式:
Direct Prompt Enhancement
参数值:
direct适合大多数文生图和图片编辑任务。
它会在不明显改变用户目标的前提下,补充画面风格、构图、光线和细节。
Agent Prompt Enhancement
参数值:
agent适合复杂文生图任务。
Agent模式会对需求进行更完整的分析和整理,适合信息图、商业海报、UI界面和多模块视觉。
目前Agent Prompt Enhancement只支持文生图,不支持图生图或图片编辑。
对于已经写得非常详细的专业提示词,也可以关闭prompt_extend,避免系统重新解释原始要求。
支持负向提示词和固定Seed
Qwen-Image-3.0 API提供:
negative_promptseedwatermarksizenprompt_extend
等控制参数。
负向提示词可以描述不希望出现的内容,例如:
不要水印,不要无意义文字,不要多余人物,
不要改变商品颜色,不要错误Logo。固定Seed有助于让多次生成保持相对接近的初始随机状态,但并不能保证不同模型版本或不同时间的结果完全一致。
API默认不添加水印,开发者可以根据自身应用场景决定是否开启。
Arena文生图榜国内第一
截至2026年8月5日,Arena.ai Text-to-Image Arena显示:
| 排名 | 模型 | 得分 | 状态 |
| 5 | Qwen-Image-3.0-Pro | 1263±11 | Preliminary |
| 6 | Gemini 3.1 Flash Image | 1262±5 | 正式统计 |
| 7 | Seedream 5.0 Pro | 1257±5 | 正式统计 |
Qwen-Image-3.0-Pro目前是榜单中排名最高的中国模型。
但需要注意:
- 当前只累计约2801次投票
- 榜单仍标记为Preliminary
- 分数会随新增投票发生变化
- 一分左右的差距不代表稳定领先
- 真人偏好榜无法覆盖所有专业场景
因此,“文生图国内第一”有当前榜单支持,但不能写成永久排名或所有能力全面第一。
Qwen-Image-3.0适合哪些商业场景?
品牌与广告设计
可以根据完整Brief生成包含品牌文案、产品、卖点和活动信息的海报初稿。
电商视觉
适合生成:
- 商品场景图
- 活动主图
- 卖点信息图
- 商品海报
- 社交媒体广告
- 海外多语言素材
新媒体内容
可以制作:
- 小红书封面
- 公众号头图
- 微博配图
- 知识卡片
- 九宫格图文
- AI资讯海报
UI与产品设计
可用于快速生成网页、App、数据看板及游戏界面的概念图。
教育和知识内容
可以将知识点、公式、流程和时间线转化为信息图或教学海报。
跨境营销
12国语言文字渲染能力适合不同市场的本地化广告、包装和社交媒体素材。
企业批量工作流
标准版0.18元一张的价格,适合接入批量营销素材、内容运营和自动化设计流程。
Standard版和Pro版应该怎么选?
选择Standard版
适合:
- 预算敏感
- 大批量生成
- 社交媒体配图
- 普通产品场景
- 内容创作
- 初期方案探索
- 对小字精度要求不极端
模型ID:
qwen-image-3.0选择Pro版
适合:
- 长文字海报
- 复杂信息图
- 多语言排版
- UI界面
- 高密度知识内容
- 精细商品与人物
- 正式商业方案初稿
模型ID:
qwen-image-3.0-pro可以先使用标准版进行低成本构图探索,选定方向后再用Pro版生成最终候选方案。
API调用时需要注意什么?
图片链接只保留24小时
API返回的生成图片URL有效期为24小时。开发者需要及时下载并保存到自己的对象存储。
北京和新加坡使用不同API Key
中国北京地域和新加坡地域使用不同的API Key与请求地址,不能混用。
正式文字仍需人工校对
模型文字能力很强,但不能保证价格、日期、品牌名和长段落绝对正确。
API开放不等于开放权重
截至8月5日,官方此次明确开放的是在线体验和API服务。公开资料暂未给出Qwen-Image-3.0模型权重、参数规模及完整技术报告,因此目前应将其视为托管式商业模型,而不是已经可以本地部署的开放权重模型。
生成知识图时需要核查事实
图像中的公式、数据、地图和科学结构可能看起来合理,但内容仍可能错误。
商业素材要检查版权
参考图片、字体、人物肖像、品牌Logo及商品素材,需要确认拥有相应使用权。
总结
Qwen-Image-3.0已经于2026年8月5日正式上线千问AI平台,并开放标准版和Pro版API。
标准版qwen-image-3.0的文生图价格为0.18元一张,1K和2K输出采用相同价格;Pro版qwen-image-3.0-pro则分别为1K 0.25元、2K 0.5元。
模型系列支持:
- 最长约4.5K Token复杂指令
- 12国语言文字渲染
- 100多种艺术风格
- 约10像素小文字
- 复杂信息图和图文版面
- UI及游戏界面
- 文生图和图片编辑
- 最多3张参考图片
- 单次最多6张输出
- 最高2048×2048分辨率
- Agent Prompt Enhancement
在Arena.ai最新文生图真人盲测中,Qwen-Image-3.0-Pro暂列全球第五,并成为当前排名最高的中国模型,但成绩仍处于初步统计阶段。
Qwen-Image-3.0最值得关注的地方,不只是图片更写实,而是它开始处理过去必须由设计师在多个软件中完成的复杂任务:
把长文案、数据、公式、布局、图片和视觉风格放入同一个指令,再直接生成一份结构相对完整的视觉成果。
对于自媒体、电商、跨境营销、UI设计和企业内容团队而言,0.18元一张的标准版API,也进一步降低了将高信息密度图像生成接入商业工作流的成本。
不过,正式商用前仍需人工检查文字、事实、商品细节、品牌规范及版权。API全量上线也不等于模型权重已经开放,本地部署仍需等待后续官方消息。










评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。