Qwen开源Qwen-Image-2.1:7B参数统一文生图与图像编辑,原生支持透明图
千问团队开源Qwen-Image-2.1,视觉生成部分仅7B参数,将文生图与图像编辑整合在同一模型中,原生支持透明图像的生成与编辑,最多支持10张参考图输入。
AI解读:千问团队开源了Qwen-Image-2.1,把文生图和图像编辑塞进同一个模型,视觉生成部分只有7B参数。官方称它是目前千问图像系列里兼顾生成效果、推理效率与使用成本的开源图像模型。
这次最值得注意的能力有两个。一是原生透明图像生成与编辑,模型能根据提示词自动决定输出普通图还是带透明通道的图,透明图层里的文字也能改。二是多图编辑,最多可以同时输入10张参考图。
效率方面,官方说优化在多图输入场景尤其明显,靠的是混合粒度注意力和KV Cache复用。人像和商品保真、文字排版与人物光影也有针对性提升。
对做设计、电商和内容创作的人来说,透明通道和多参考图组合直接对应素材制作和穿搭、家居等合成需求。不过官方没有给出与竞品的具体对比数字,实际效果还需要上手验证。
千问团队开源Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅有7B参数,并原生支持透明图像的生成与编辑。
据千问官方动态,Qwen-Image-2.1的视觉生成部分包含32层Single-Stream DiT,参数量为7B。官方称其在较小的模型规模下仍具备出色的图像生成能力。
效率优化方面,模型采用混合粒度注意力结构:文本部分包括系统前缀和编辑指令采用Token级因果掩码,图像生成部分采用Chunk级掩码;同时通过KV Cache复用机制,将输入图像与编辑指令作为静态上下文在首步预计算并缓存,以提升推理效率、降低显存开销。官方称这一优化在多图输入场景中尤其明显。
原生透明:统一模型内置透明图生成与编辑
透明图像是本次更新的一项重要能力。千问曾于2025年12月发布Qwen-Image-Layered,专门支持透明图像生成。现在Qwen-Image-2.1将这项能力整合进统一模型,能够根据提示词描述,自动决定输出普通图像还是带有透明通道的图像。
作为文生图与图像编辑二合一的模型,Qwen-Image-2.1也支持直接编辑透明图像,例如在保留透明背景的同时修改主体表情。透明图层中的文字同样可以编辑。
这项能力也适用于真实照片:输入一张RGB图像,模型可以提取所需主体,输出带透明通道的RGBA图层。
编辑能力:最多10张参考图,支持圈选、涂抹与掩码
Qwen-Image-2.1的图像编辑能力围绕“多”“局”“保”“全”四个方向提升。
多:模型最多支持10张参考图输入,官方示例包括将6张人像整合进同一张合照、输入模特衣服鞋子包包帽子共5张图片生成完整穿搭、参考10张家居图片生成室内布置效果。
局:支持圈选、涂抹和独立掩码等局部编辑方式。官方示例中,通过不同颜色的圆圈同时指定三个区域,要求模型去掉蓝色圈的金属手表、把红色圈的头发改为黑色、把绿色圈替换为灰色短袖亚麻睡衣。模型也支持通过涂抹指定区域,以及将原图和独立掩码作为两张图片输入以保留完整原始图像信息。官方还展示了通过逐步修改画面并保持其他区域一致性,将编辑结果串联成简单动画。
保:编辑保真重点强化人像一致性与商品一致性。人像编辑中模型增强对面部特征的保留能力,商品编辑中尽可能保持商品文字、纹理与形态一致。
全:模型同时支持全景图、信息图与分镜图生成等多种编辑任务。
文字与人物:官方称提升排版与光影细节
Qwen-Image-2.1进一步提升了图像质感,尤其关注文字与人物的美学表现。文字生成除了关注内容本身,也注重字体、排版与画面的整体协调。在人物表现上,模型增强了光影与细节刻画。
千问表示,Qwen-Image-2.1以轻量的7B视觉生成模块为基础,将图像生成、透明图像与多种编辑能力整合在同一模型中,通过推理加速、最多10张参考图输入、灵活的局部编辑以及更好的人像和商品保真,为设计、内容创作、电商与视觉叙事提供工具。官方博客还展示了Qwen-Image-Bench公开评测对比,但未在文字中给出具体分数。