大家好,我是吾鳴。专注于分享提升工作与生活效率的工具,无偿分享AI领域相关的精选报告,持续关注AI的前沿动向。
这两天,千问又扔出来了一个新的图片生成大模型——Qwen-Image-3.0。
第一次看官方的展示图的时候,我确实是有点儿没有反应过来,它生成的不是一张普通的海报,也不是我们已经看腻了的AI美女,而是直接在一张图片中塞进了9张风格完全不同的PPT,每一页都有独立的标题、正文、公式和插图。

更为夸张的是,官方还表示Qwen-Image-3.0可以接受最长约4500 Token的输入,生成报纸、试卷、分镜、知识信息图等复杂的图片排版;能够渲染小到10像素的文字,支持12种语言、多种字体、100多种艺术风格,还能模拟网页、游戏、直播等不同UI界面。

看起来确实是很不错。
但是看完这些案例,我脑子里面冒出来的第一个问题不是“这模型到底有多强?”,而是“ **普通用户随手输入一段提示词,也能得到这样的结果吗? **”。
毕竟AI图片模型的官方演示,我们已经看得太多了。
缩略图看起来很惊艳,放大之后,全是错别字;海报第一眼看有模有样,仔细一看,日期、价格、地址没有一个是对的;信息图排得密密麻麻,看起来知识量很大,实际则是在一本正经胡说八道。
所以,这一次我不打算拿几条“一个女孩站在海边”之类的简单提示词跑一遍,然后挑几张好看的图片夸它厉害。
既然Qwen-Image-3.0敢说自己能生成9页PPT、报纸、试卷、信息图和复杂UI,那我就按照真正干活的标准,把它往死里测一遍。
案例1: 一张图片,真的能生成9页PPT吗?
我希望Qwen-Image-3.0可以按照官方给的样例图,去生成一张塞进了九张不同风格PPT的图片。
提示词很长(近2500字),这里我只截取了部分,提示词中详细描述每一个格子的内容的部分已经被我省略。
生成一张超高清16:9横屏图片。
整张图片是一面由9张独立知识课件组成的九宫格展示墙,按照3列×3行排列。每一个格子都是一张完整、独立、横向16:9比例的微型课件或知识信息图。
重要要求:
1. 九个格子大小完全一致,排列整齐,格子之间保留窄而均匀的白色间距。
2. 九个格子必须拥有各自独立的标题、内容、构图和视觉风格。
3. 不要设置整张图片共同的大标题。
4. 不要让任何文字、人物、箭头或图形跨越格子边界。
5. 不同格子的内容不得互相混合,不得重复。
6. 每一格都必须像一张可以独立使用的完整课件,而不是简单图标或缩略图。
7. 所有指定文字、数字、公式、单位和符号必须准确显示。
8. 中文使用规范简体中文,英文不得出现拼写错误。
9. 所有小字在放大后仍然清楚可读。
10. 九个格子可以使用不同的设计语言,但每一格内部必须风格统一、信息层级清楚。
11. 不得增加第10个格子,不得缺少任何格子。
12. 图片中不要出现水印、品牌Logo、页码或无意义乱码。
按照从左到右、从上到下的顺序生成以下九张独立课件。
━━━━━━━━━━━━━━━━━━
【第1格:交通安全三格漫画】
━━━━━━━━━━━━━━━━━━
......

生成的图片完整的按照提示词的指示生成了9个独立的PPT页面,每个页面中的标题都严格按照提示词中指定的文案生成,这张图中出现的文字,放大去看,都没有出现乱码,中文文字渲染稳定,看来官方的案例也不是吹的。
案例2:中文文字海报,能不能一次交付?
很多图片模型已经能够生成几个醒目的大标题海报,但是真正做商业化的设计,不可能只有一个标题,还会有时间、地点、嘉宾、活动流程等等信息。
所以这个案例,不要让大模型自己去发挥,而是海报中的内容都通过提示词去严格的指定。
设计一张竖版科技活动海报,比例3:4,整体风格简洁、高级、现代,背景使用深蓝色渐变和少量发光线条。
海报必须准确包含以下文字:
主标题:2026杭州AI创作者大会
英文副标题:AI CREATOR CONFERENCE
日期:2026年8月16日
时间:09:30—17:30
地点:杭州未来科技城国际会议中心
活动主题:从使用AI,到建立自己的AI生产力
嘉宾:
陈晨|AI产品独立开发者
林晓|品牌视觉设计师
周远|内容创业者
上午议题:AI工具、智能体与自动化工作流
下午议题:AI图片、短视频与商业变现
按钮文字:立即报名
底部小字:限额300人,报名成功后将通过短信通知
主办方:未来创作实验室
右下角保留一个清晰的正方形二维码占位框,框内写“扫码报名”。
所有文字必须使用规范简体中文,信息不得遗漏,不得自行修改姓名、日期、时间和地点。

生成的海报中的标题、时间、地点、嘉宾等信息都是按照提示词严格生成,并且最下方的小字没有乱码。
测到这里,Qwen-Image-3.0在文字处理上确实是有了质的飞跃,不会像之前的模型,生成的图片文字乱七八糟的。
案例3:密密麻麻的小字,究竟能小到什么程度?
因为官方提到了10像素级别的小字,所以不能放过小字的测试,这个案例让它去生成一张商品参数说明书。
生成一张横版产品规格说明图,比例16:9,白色背景,专业工业设计风格。
产品名称:M-ONE桌面AI工作站
左侧展示一台银灰色小型桌面电脑的三视图,包括正面、侧面和背面。
右侧是一张整齐的参数表,必须准确包含:
处理器:12核心高性能处理器
内存:32GB统一内存
存储:1TB固态硬盘
网络:Wi-Fi 7与2.5G有线网络
接口:2个USB-C、3个USB-A、1个HDMI
显示输出:最高支持两台6K显示器
整机重量:1.28千克
产品尺寸:197毫米×197毫米×36毫米
保修期限:两年有限保修
包装清单:主机、电源适配器、USB-C数据线、快速入门指南
图片最下方增加一段小字:
“本页面展示的产品为虚构测试产品,所有参数仅用于测试AI图片模型的中文小字渲染、数字准确性和复杂排版能力,不代表任何真实商品。”
所有参数必须保持原文,不得修改数字、单位或接口数量。表格线条清晰,文字从大标题到小字形成明显字号层级。

可以看到生成的图片最下方的小字,这个级别的字体,其实已经是够小的了,可以把图片放大去看,会发现小字的支持也是非常的好的,这里需要站起来点赞。
案例4:数学公式,不允许差一个字符
文字写错一个字,那可能只是尴尬一下,但是公式写错了一个符号,那意思可能就完全不相同,这一轮专门测试上下标、根号、分数和希腊字母。
生成一张横版“高中数学核心公式速查表”,比例16:9,排版像专业教育机构制作的知识海报,米白色背景,分成6个清晰区域。
必须准确展示以下公式:
勾股定理:a² + b² = c²
一元二次方程求根公式:x = (-b ± √(b² - 4ac)) / 2a
等差数列通项公式:aₙ = a₁ + (n - 1)d
等差数列前n项和:Sₙ = n(a₁ + aₙ) / 2
等比数列前n项和:Sₙ = a₁(1 - qⁿ) / (1 - q),q ≠ 1
圆的面积:S = πr²
每个公式下方增加一个简洁的中文说明和一个小型示意图。
所有上下标、括号、根号、正负号、分数线、π和不等号必须准确,不得缺失或替换。

可以看到生成的图片中的公式那可是100%的准确率,这个水平,生成的图片都可以直接拿去当教程了。
案例5:12种语言同时出现,还能不能保证正确
官方表示模型具备12种语言的渲染能力,单独生成一种语言不算极限,这个案例直接让12种语言都生成到一张图片中。
生成一张竖版国际文化节海报,比例3:4,主题为“你好,世界”,设计风格热情、现代、多元文化。
海报中央使用12个整齐排列的彩色卡片,每张卡片准确展示一种语言及其问候语:
中文:你好
English:Hello
日本語:こんにちは
한국어:안녕하세요
Español:Hola
Français:Bonjour
Deutsch:Hallo
Italiano:Ciao
Português:Olá
Русский:Привет
العربية:مرحبًا
ไทย:สวัสดี
顶部标题准确写成“世界文化交流日”。
底部文字准确写成“语言不同,表达友好的心意相同”。
必须保留每种语言原有的字母、重音符号、字符方向和书写方式,不得把不同语言混在一起。

12种语言,数量上没有错误,同时有些语言上面会有一些奇奇怪怪的字符,我看都有还原,懂的朋友可以看看这个案例有没有错?
案例6:数量、位置和空间关系
图片模型都有一个很大的通病,那就是不太会数数,所以这个案例不堆审美,专门堆硬核的约束。
生成一张四层垂直农场的建筑剖面信息图,比例16:9,可以清楚看到建筑内部四层空间。
第一层位于最下方,有且只有2名工作人员,1男1女,两人正在检查3个蓝色储水罐。
第二层有且只有3台白色农业机器人,机器人分别位于左侧、中间和右侧,正在照料5排生菜。
第三层有且只有4排草莓种植架,每排种植架上方有1盏紫色植物灯,共4盏灯。
第四层位于最上方,有1架黄色无人机和2个大型通风风扇,无人机位于两个风扇之间。
建筑最左侧有一部透明电梯,从第一层贯穿到第四层。
建筑右侧外部停着2辆绿色运输车,车辆不能出现在建筑内部。
屋顶安装6块太阳能板,按照2行×3列排列。
所有数量和位置必须严格准确,不得增加人物、机器人、车辆、风扇、太阳能板或其他物体。

生成的图片严格按照提示词要求的四层垂直农场剖面图,第一层只有两人,一男一女加三个蓝色储水罐;第二层,3个白色机器人,左、中、右照顾着5排生菜;第三层,4排草莓种植架,4盏灯;第四层,1架无人机,2个通风扇,无人机位于中间。
这个案例生成的图片,数量、位置和空间关系,与提示词完全对应上了,很少有模型能做到。
案例7:知识型信息图,是知识还是“知识感”?
很多AI图片的最大问题,不是不会排版,而是特别擅长制作一种好像很专业的感觉,这个案例就用基础天文知识进行检查。
生成一张横版太阳系知识信息图,比例16:9,深色宇宙背景,科学教育插画风格。
从左到右依次展示太阳和八大行星,顺序必须准确:
水星、金星、地球、火星、木星、土星、天王星、海王星。
每颗行星下方准确标注中文名称,不得颠倒顺序。
地球旁边只画1个月球。
火星使用红褐色外观。
木星体积最大,并展示明显的大红斑。
土星展示清晰的行星环。
天王星使用浅青色,并表现出明显倾斜的自转轴。
海王星使用深蓝色。
图片底部写出:
“距离太阳越远,行星公转一周所需的时间通常越长。”
不要添加冥王星,不要出现第九颗行星,不要把月球画成独立行星。

从生成的图片来看,行星的顺序从左到右完全正确,对应的文字也正确,行星的视觉特征与提示词描述的吻合。
案例8:模拟一个真的能用的网页界面
官方展示了网页、游戏、直播等UI模拟能力,所以我让它生成一个AI图片工作台。
生成一张桌面端网页界面截图,比例16:9,网页名称为“PixelFlow AI图片工作台”,整体风格简洁、现代,浅色界面。
顶部导航栏从左到右依次为:
PixelFlow
图片生成
图片编辑
灵感广场
我的项目
右上角显示“剩余积分:1280”以及圆形用户头像。
左侧是参数设置栏,包含:
模型:Qwen-Image-3.0
图片比例:16:9
生成数量:4
清晰度:2K
风格:商业摄影
中间是一个大输入框,输入框中准确显示:
“一杯放在木质桌面上的冰拿铁,清晨阳光从左侧照入,杯壁有真实水珠,背景为安静的现代咖啡馆。”
输入框下方有一个蓝色按钮,文字为“开始生成”。
右侧展示4张生成结果缩略图,按照2×2排列。
页面底部显示任务状态:
生成时间:12.8秒
本次消耗:8积分
任务状态:生成完成
所有按钮、数值和中文文字必须清晰,网页元素之间对齐,不得出现重叠。

可以看到这整个网页的排版设计都是和生产上的网页相似,提示词中只是描述了网页有的内容、风格、配色,但是网页是否合理,这个在提示词中是没有要求的,靠的是模型的自由发挥。
案例9:写实人像和复杂材质
前面的测试都是偏向理性的,这个案例开始回到传统图片模型最擅长的领域——写实,但是我会把最容易翻车的材质放在一起。
生成一张电影感写实摄影作品,比例16:9。
一位约65岁的亚洲男性坐在雨后夜市的一家小面馆门口,人物位于画面右侧,侧脸看向左方。
他的脸上有自然皱纹、毛孔、少量胡茬和被雨水打湿的头发,不要磨皮,不要塑料皮肤。
他右手握着一个透明玻璃杯,杯中是热茶,杯壁有水汽;左手放在膝盖上,五根手指结构自然。
人物穿着一件深棕色旧皮夹克,皮革表面有使用痕迹,内搭粗织灰色毛衣。
前方是不锈钢桌面,桌面同时反射红色灯笼和蓝色霓虹灯。
背景有人群、蒸汽、玻璃窗、湿润地面和模糊的中文招牌,但背景文字不需要清晰。
使用85毫米镜头效果,浅景深,真实摄影质感,不要插画感,不要过度锐化,不要夸张HDR。

生产的这张图片,我们可以看看皮革、毛衣的材质,玻璃杯和冒出来的水汽,手指的关节,毛发这些细节,觉得处理得还是很不错的。
案例10:电商产品图能不能直接拿来卖货?
对于普通用户来说,生成一张普通的艺术图或许只是好玩,但能不能做商品主图、广告海报和详情页,才是真正的生产力。
生成一张竖版高端护肤品商业广告,比例3:4。
产品是一瓶虚构的精华液,品牌名称必须准确写成“AERINOVA”,产品名称为“焕亮修护精华液”。
瓶身为磨砂半透明玻璃,银色金属瓶盖,瓶内液体呈淡金色。
瓶身文字从上到下依次为:
AERINOVA
焕亮修护精华液
BRIGHTENING REPAIR SERUM
30 mL
产品位于画面中央,放在湿润的浅色岩石上,周围有少量透明水珠和白色花瓣。
海报左上方标题准确写成:
“让肌肤重新透出光”
下方展示三个卖点:
“改善暗沉”
“补水保湿”
“强韧屏障”
右下角写:
“新品体验价 ¥199”
整体使用真实商业摄影风格,光线柔和高级,产品瓶身结构、反射、标签和所有文字必须清晰准确。

品牌名、瓶身文字、价格等信息与提示词完全一致,磨砂玻璃和金属瓶盖的材质非常的真实有木有?
案例11:六格故事,人物会不会每一格都换脸?
单张图好看不难,难的是让一个人物连续出现。所以这个案例想测试一下模型的人物一致性。
生成一张横版六格电影分镜图,比例16:9,六个画面按照2行×3列排列,格子边界清晰。
故事主角始终是同一个24岁亚洲女孩。
她有齐肩黑色短发,左眼下方有一颗小痣,穿黄色雨衣、黑色长裤和白色运动鞋,手中始终拿着一把红色雨伞。
一只橘色小猫贯穿整个故事,小猫右耳尖有一小块白色毛。
第1格:女孩在雨夜街边发现躲在纸箱里的小猫。
第2格:女孩蹲下,把红色雨伞移到小猫上方。
第3格:小猫从纸箱中走出来,女孩伸出左手。
第4格:女孩抱起小猫,红色雨伞放在她右肩上。
第5格:女孩抱着小猫走进一家亮着暖黄色灯光的宠物医院。
第6格:雨停了,女孩坐在医院门口,小猫趴在她腿上,远处出现一道彩虹。
六格中的女孩必须保持相同脸型、发型、痣的位置、服装和年龄;小猫必须保持相同毛色和右耳白色特征。每一格动作和故事顺序必须准确。

可以看到生成的六宫格图片中,每一个的女孩的一致性都保持的很好,无论是发型,服饰,样貌等;但是也有一些瑕疵,比如第三张图只有伞柄,第二和第四张图有两把伞。
还有女孩脸上的痣的位置最后一张图的时候乱掉了,以及毛耳朵的毛的颜色,这些小细节上还是处理的不够好。
案例12:100多种风格,不如先让16种同框
官方提到Qwen-Image-3.0覆盖100多种艺术风格,我不准备真的生成100张,但可以把同一个主题做成16宫格,看风格之间是不是真的有明显差异。
生成一张正方形16宫格艺术风格对照图,画面按照4行×4列排列。
16个格子表现完全相同的主体:一只坐在窗边看雨的橘猫,窗台上放着一杯咖啡和一本打开的书。
每个格子使用不同艺术风格,并在格子底部准确标注风格名称:
写实摄影
中国水墨
工笔画
油画
水彩画
彩色铅笔
儿童绘本
日系动漫
美式漫画
像素艺术
黏土定格
低多边形3D
剪纸艺术
木刻版画
复古海报
赛博朋克
16个格子的主体、动作和物品数量保持一致,但艺术风格必须具有明显区别。格子不得缺失或重复。

最后总结
把这12个案例跑完之后,我对Qwen-Image-3.0最大的感受,不是它又把图片画得更漂亮了,而是它开始真正具备了“把一份复杂需求做完整”的能力。
九宫格PPT、中文海报、小字参数表、数学公式、12种语言、数量关系、知识信息图、网页UI,这些任务放在以前,通常要在文字、排版和画面之间做取舍:要么图很好看,但文字不能读;要么字勉强正确,但整个设计像一张粗糙的草稿。Qwen-Image-3.0这一次最明显的进步,就是把这几件事情同时往前推了一大步。
尤其是中文文字渲染,已经不再只是“偶尔能写对几个大字”。从标题、姓名、日期、价格,到参数表、公式和页面底部的小字,它在大部分案例中的表现都相当稳定。数量、位置和空间关系这些传统图片模型经常翻车的地方,这次也给了我不少惊喜。
当然,它还远远没有到可以闭着眼睛直接交付的程度,六格分镜中会凭空多出一把伞,人物脸上的痣会移动,小猫耳朵的特征也会在连续画面中发生变化。换句话说,它已经能把一张复杂图片的“大框架”做得非常完整,但在人物一致性、局部细节和连续逻辑上,仍然会露出AI的马脚。
所以,Qwen-Image-3.0并不是一个完全不会出错的自动设计师。它更像是一名能力很强、执行速度很快,但交稿后仍然需要你认真检查一遍的视觉助手。
好了,本文的分享就到这里,如果您觉得有收获的话,可以给个一键三连,您的鼓励是吾鳴持续输出的最大动力。