做 PPT 不用再抠图了:免费模型直接生成透明底,有张普通显卡就能跑
- 2026-09-24 02:13:06
前几天,千问放出了 Qwen-Image-2.1 ,同时开放了权重。
我看到这条消息的第一反应是,又一个文生图模型。
今年这个赛道我见得太多了。
每周都有新的,每个都说自己刷新了什么榜。
卷到这个程度,说实话我早就麻木了。
所以我本来打算划过去。
直到我看见官方介绍里的四个字。
原生透明。
这四个字意味着什么,我花了一个晚上把它翻清楚了。
先说结论。
它不是把抠图做得更好了。它是把抠图这个动作,从你的流程里删掉了。
这个差别很大,我后面会讲清楚。
先说说这个东西是什么。
它由阿里的千问团队在 9 月 20 日发布,权重放在 Hugging Face 和 ModelScope 上,代码在 GitHub 。
GitHub 上这个仓库是 9 月 14 日建的, 9 月 20 日推了代码,现在挂着 1100 多个 star 。
它把自己定位成千问图像系列里最均衡也最省的那一个。

先把它的位置摆清楚。
官方那套 Qwen-Image-Bench ,它拿了 60.28 分,总榜第七。
排在前面的几个,要么闭源,要么只能按次调用。
同一张榜上参与对比的开源模型,它的分数是最高的。
也就是说它不是最强的那个,是开源里目前最能打的那一批。
这一条我特意留着没说全。一个模型值不值得装,先看它站在什么位置,再看它有什么别人没有的东西。
注意这里有个数字很多人会看错。
官方给的参数是 7B 。
很多人看到这个数字就去估显存。不对,那个 7B 只是视觉生成那一部分,也就是 32 层的扩散 Transformer 。
整套流程跑起来,还要再挂一个 8B 的 Qwen3-VL 文本编码器。
所以你要是拿 7B 去估显存,大概率会白买一张卡。
这种说一半留一半的参数说明,我看得挺烦。
了解我的人知道,我判断一个模型值不值得看,先看三件事。
能不能装、装了要多少钱、装完之后我拿它干什么。
这次我重点盯的是第三件。
因为它这次真正变了的,是能吐什么东西出来。
普通文生图模型吐的是 RGB 图,三个通道,红绿蓝。
它吐的是 RGBA ,多了一个 alpha 通道,也就是透明度。
别小看多出来的这一个通道。
过去的流程是这样的。
你先让模型生成一张图,图的背景是画上去的。然后你再找个抠图工具,把背景去掉,拿到一张透明底的 PNG 。
也就是说,生成和去背,永远是两步。
这两步里,卡人的地方全在第二步。
人像的发丝,动物的绒毛,玻璃杯的边缘,薄纱那种半透明的材质,抠完之后往往带着一圈脏边。
更坑的是背景是一面白墙的时候。
抠出来的主体边缘会带一圈墙的颜色,你放大一看,那条灰边特别明显。
你得手动修,修半天还是修不干净。
Qwen-Image-2.1 把这两步合成了一步。它在生成的时候,就把 alpha 通道一起算出来了。
官方说明里讲得更技术一点。它的 VAE 是 64 通道的 RGBA 自编码器, 16 倍空间压缩,原生支持透明。
这个能力的直接结果就是,你问它要什么底,它就给你什么底。
更关键的是提示词。官方给了固定格式,中文版是这样的。
「这是一张带有透明度的 RGBA 图像。.... 该图像具有 alpha 通道,背景是透明的。」
中间那个省略号,填你要的画面。
这句不是我翻译的,是官方 Demo 页面上印着的原话,连标点都是原来的。
社区里跑过的人还补了一条更实用的经验。
想拿到干净的透明素材,把这个声明放在提示词最前面,比放在后面有效得多。
这一条我建议你直接抄下来存着。 我把它拆成三段,你照着填就行。
第一段放声明,先告诉它你要透明底。
第二段放主体,你想要什么就写什么,越具体越好。
第三段放收尾,再强调一遍背景是透明的。
还有两个细节容易被忽略。
一个是留白。你要拿它做 PPT 的配图或者主图,就在描述里写清楚主体偏左或者偏右,给文字留出地方。
另一个是边缘。透明不等于边缘干净,毛茸茸的东西生成完还是会有半透明的残影。
这一条没什么好办法,只能自己放大看一眼。
第二个能力是反向的,也就是把一张普通照片里的主体,抽成一个透明图层。
这件事以前是抠图工具在干。现在同一个模型就能做。
第三个能力是局部编辑。
你可以圈选,可以涂抹,也可以单独上传一张蒙版。
模型只重建你圈出来的那一块,其他地方不动。
它还能同时吃进去最多 10 张参考图。
官方给的例子是,用 6 张人像拼一张合影,或者用 5 张素材拼一套穿搭。
十张参考图这个数字听起来没什么。
但它背后的意思是,你不再需要先拼好再生成,可以在生成的同时就合成。
还有两个数字和开关,值得单独说一句。
一个是尺寸。它的出图是原生 2K 。
官方 Demo 的预设给了一排: 16:9 是 2688 乘 1536 , 1:1 是 2048 乘 2048 , 4:3 是 2368 乘 1728 。
这不是先画一张小图再放大,是一开始就按这个尺寸画。
做贴纸、做主图,尺寸够不够用,你心里应该有数了。
另一个是官方 Demo 上默认打开的一个开关,叫智能改写提示词。
你写一句短的,它先帮你扩写成一段详细描述,再去生成,改写结果会显示在旁边的框里。
做透明底的时候,这个开关我建议你先关掉。
道理不难懂。你要的是"画面里只有主体",但改写会顺手帮你把光线、环境、桌面这些词补上。
官方排错清单里写着一条:提示词里一旦出现背景的描述,模型就会还你一张不透明的图。
改写机器那点好心,正好撞在这条上。
它是帮你把话说完整的,不是帮你把话说准的。
平时生成带背景的图,开着它确实省事。一旦你要的是透明底,这一步得拿回来自己做。
光讲它吐什么,还是虚的。
我把自己跑出来的三张先摆在这儿。
不是官方示例,是我在自己机器上一次过的结果。
第一张我挑了最普通的题材,贴纸。
提示词就是上面那个格式,我照着一句一句填。
「这是一张带有透明度的 RGBA 图像。一只围着红色围巾的柴犬,坐在原地,扁平插画风格,黑色描边,全身完整,主体居中。该图像具有 alpha 通道,背景是透明的。」

每张图我都放了两个底,左边深色,右边浅色,是同一张原图。
你把眼睛放在主体边缘上。
那条边如果在浅色底上发灰、在深色底上发白,说明它是带着背景色一起被抠下来的。
这一张的边没有这个问题。
第二张我故意挑了个难缠的。
植物的叶片一片压一片,还带锯齿,抠图工具在这种地方最容易干不干净。

叶子和花盆的边我看过了,也是干净的。
第三张我想验证的是另一件事。
一杯手摇奶茶,塑料杯身能看见里面的分层,还插着吸管。

这张难在“透明”这个词本身有两层意思。
一层是说杯身透光,能看见里面的茶。
另一层是说这张图本身没有背景。
两个透明得在同一张图里同时成立。
它做到了。
这三张我没有修过一笔。
跑完这三张的是一张 2080 Ti , 22GB 显存,用的是 int8 加 W4A8 那套量化权重。
1024 乘 1024 , 20 步,采样大概 7.5 秒一步。
第一张花了五分钟,因为要把十四 GB 的权重从硬盘搬进显存。
后面两张每张两分半。
三张加起来不到十分钟,中间我没动过任何参数。
这个速度谈不上快。
但它不排队,不扣额度,拔了网线也能跑。
丑话我也说完。
放大到百分之百,背景里有一层很淡的杂点,占全部像素的百分之一到百分之四,看主体大小浮动。
正面看完全看不见,叠到别的图里也看不出来,但它确实在那儿。
真要做精细的合成,这一步得你自己补一刀。
边缘那圈过渡像素占不到百分之一点五。
这是生成方式决定的,不是它这次没做好。
做配图、做贴纸、做电商主图,这些完全够用。
要印大幅物料,还是得放大检查一遍再送去印刷。
说了这么多它能干什么,你大概已经在想一件事。
我手上没有能跑它的机器。
这是最多人卡住的地方。
所以我先把顺序倒过来,先说怎么不装任何东西、不花一分钱,在浏览器里把它用起来。
第一个入口是魔搭的 AIGC 专区,阿里自己的模型社区。
地址是 modelscope.cn/aigc ,进去点图片生成。
模型那一栏第一个就是 Qwen Img 2.1 。
注册送 200 魔粒值,绑一个阿里云账号每天再加 50 ,出图按魔粒扣。
界面全中文,提示词直接写中文就行,不用先翻成英文再喂进去。

第二个入口是魔搭上的官方 Demo ,叫创空间。
地址 modelscope.cn/studios/Qwen/Qwen-Image-2.1 。
这个是 Qwen 团队自己放的,界面简陋得多,但更接近模型本来的样子。
我前面引的那句提示词格式,就是从它页面上抄下来的。

第三个入口叫呜哩 AI ,网址 wuli.art ,蚂蚁做的。
官方说明里专门点名了它,说大陆用户在这里可以免费用全部功能,包括透明背景。
手机号注册,不用绑卡,每天 50 次。
50 次够干什么。你从一张粗胚调到满意,十几二十次基本就收敛了。
也就是说,一天能完整调两三轮。
额度这种事平台随时会调,用之前建议自己在页面上再确认一眼,别只看二手信息。
三个入口有一个共同的前提,得先注册。
魔搭要注册,呜哩要手机号,官方 Demo 也是。
我试过不登录直接点生成,结果框里弹的是「错误」,提示信息还看不太懂。
好在注册这件事,成本也就一分钟。
三个入口里,我会先开魔搭那个官方 Demo 。
它没有额度概念,也没有一堆运营位,最接近“这个东西本身长什么样”。
先看它出的东西对不对你的路子,再决定要不要往自己机器上搬。
你要是进去之后不知道先试什么,把我下面这句原样粘进去。
「这是一张带有透明度的 RGBA 图像。一只围着红色围巾的柴犬,坐在原地,扁平插画风格,黑色描边,全身完整,主体居中。该图像具有 alpha 通道,背景是透明的。」
出图之后别急着点评它画得好不好。
先做一件事,把这张图分别拖到深色底和浅色底上各看一遍。
背景跟着变,说明你手上这张是真的透明图。
背景纹丝不动,说明它只是给你画了一块白底,你白忙一场。
这一步三十秒,但它决定你后面所有的判断是不是有效的。
我见过太多人拿到一张带白底的图,接着往下调了十几轮,问题从一开始就没解决。
然后是门槛,这是我最不想含糊的一段。
官方放出的 BF16 版本,三块文件加起来 33.1GB 。
transformer 14.2GB ,文本编码器 17.5GB , VAE 1.35GB 。
注意第二块比第一块还大,这是很多人第一次配置时最容易漏算的地方。
这个数字会劝退一大批人,我第一次看到它的时候也有点无语。
不过官方压根没给最低显存要求,所以社区把量化版本做出来了。
Comfy-Org 那套 int8 加 W4A8 的组合,三块文件压到 14.3GB 左右。
显存不是唯一那道槛,系统内存也得跟上。有实测过的把 32GB 内存列进了推荐配置。
12GB 的卡能不能跑。压着能跑。
换更狠的 GGUF 量化, Q4_K_M 的 DiT 4.6GB ,加一个 5.88GB 的编码器,再加 VAE ,一共 11.1GB 左右,刚好塞进 12GB 的顶。
但那是贴着上限走的,中途多塞一张参考图就可能崩。
16GB 才是舒服的起步,这个档位上分辨率和参考图数量都能放开一些。
显卡真的不够,官方还留了一条后路。
官方文档里写了一行 enable_model_cpu_offload ,把暂时用不到的层放进内存,要用的时候再搬上显存。
代价是慢,出图时间会明显拉长。
但它的意义是, 8GB 这种小显存也有了跑起来的可能。社区有人靠它把显存峰值压到了 3GB 出头。
这条我是从官方文档的显存优化那一节里翻到的,写教程的人很少提,因为它不涨面子。
ComfyUI 已经出了原生节点和转换好的权重,装完之后是拖节点,不是敲代码。
但我得提醒你,自己装环境这件事,坑还是有的。
Python 版本、 torch 版本、 diffusers 版本,这三样凑不到一起就报错,报错信息还看不懂。
我第一次折腾这类环境的时候,卡在依赖冲突上卡了小半个晚上。
那些说一句话就能跑起来的教程,基本都是把这段糊弄过去了。
所以要不要自己装,你先掂量一下自己的耐心。
先说一句跟显存无关、但可能更值钱的话。
这一代的许可证换了。
上一代 Qwen-Image 走的是 Apache-2.0 ,可以商用。
这一代换成了 Qwen Research License ,条款写得很直白,只给研究和评估用途,非商业。
你要拿它出商品图、做贴纸去卖,或者接设计的活,都在这条线外面。
想商用,得单独向官方申请授权。
还有一条藏在细节里。
如果你拿它的输出继续去训练或者微调别的模型,要在文档里标明 Built with Qwen ,而且衍生出来的东西不能拿 Qwen 当主名字。
我见过有人先装环境、调了两周,最后才发现自己的活不能商用。
所以顺序应该是反过来的。先看许可证,再决定要不要折腾显卡。
还有一件和上面所有内容都无关,但你这两周必须知道的事。
remove.bg 要关站了。
它不是做不下去。恰恰相反, Similarweb 估算它今年 3 月到 8 月累计访问约 3.68 亿次,平均每月 6100 多万。
一个月访问几千万的网站主动关门,这件事本身就挺离谱。
它在自己首页挂了一条通知。背景移除功能将迁移到 Canva ,独立网站从欧洲中部时间 2026 年 12 月 1 日上午 9 点开始停止服务。

API 那一侧迁到 Leonardo.Ai ,按量付费的额度同一天失效。
这不是孤例。它背后的公司在 2021 年被 Canva 收购,旗下的 Unscreen 和 Designify 已经在 2025 年 12 月 1 日停了。
所以这不是一次意外,是一次持续了五年的产品整合。
真正让人头疼的是迁移这件事。
普通用户换个网址就完了,麻烦的是那些把它接进工作流的人。
接口要重写,鉴权要重配,返回格式要重新对齐,跑通之后还得再压一轮稳定性测试。
这一套下来,少说也得搭进去一两天。
为什么我要专门把这件事拎出来说。
因为如果你现在的工作流里还挂着它的网址或者它的接口,你已经没有多少时间了。
这个窗口剩下两个多月。
说长不长,但它比你想的更容易被忘掉,因为它不在你明天的待办里。
把拿一张透明底素材的几条路摆在一起,是这样的。
这张表里最值得看的是第一行。
从今年 9 月开始,透明背景这件事被劈成了两类问题。
一类是,我手上有一张图,怎么把它的背景去掉。
另一类是,我要一张透明背景的素材,怎么直接把它做出来。
前一类是抠图。后一类是生成。
过去十年我们一直在解决前一类,因为模型只会生成带背景的图。
这一类里跑出了 remove.bg 这种月访问几千万的产品。
后一类才刚刚开始。
它带来的变化不是省掉一个按钮,是省掉一整条链路。
你原来是生成、下载、上传到抠图网站、等结果、下载、再拿去用。
六个动作。
现在是生成、下载。
两个动作。
省下来的那四个动作,是很多人每天要重复几十遍的活。
重复几十遍这件事本身不累,累的是每次都在等。
等一次几十秒,一天下来就是大半个钟头。
那段时间你什么都干不了,只能盯着进度条。
还有那个免费档的额度,用起来一直让人心里发虚。
它不告诉你还剩多少,你只能猜,猜不准就更容易踩坑。
写到这里我想说点别的。
这一轮里被换掉的,其实不是某个抠图工具。
是一种工作习惯。
我认识不少做设计的朋友,他们最熟练的技能就是把边缘抠干净。
发丝、薄纱、半透明的塑料膜,这些地方能不能抠好,直接决定一张图能不能交。
这项技能值钱了很多年,因为它难。
现在它正在变成一句话的事。
那什么变得值钱了。
是你能不能在一开始就说清楚你要什么。
模型的提示词是你给的,参考图是你选的,哪一块要改也是你圈的。
这些判断没有任何工具能替你做。
工具把执行的活接走了,剩下的判断,全回到你这边。
这个变化我说不上是好是坏,但它肯定回不去了。
最后给你三条能马上动手的路。
第一条给所有人,不管你手上是什么机器。
打开 modelscope.cn/aigc ,选 Qwen Img 2.1 ,注册,写一句中文提示词,出图。
这套动作做完用不了十分钟。
想先看它到底能不能用,从这条走。
第二条给有显卡的。
16GB 以上可以直接上 Comfy-Org 那套 int8 权重, 12GB 就得往 GGUF 那条路走,同时把系统内存留够。
别下载完 33GB 的 BF16 才发现显存不够。
还有,先看许可证,再挑权重。
第三条给工作流里还挂着 remove.bg 的。
这周就把迁移这件事记进日历,别等到 11 月 30 日晚上才想起来。
以上,既然看到这里了,如果觉得不错,随手点个赞、在看、转发三连吧,如果想第一时间收到推送,也可以给我个星标⭐~