阿里发布Qwen-Image-2.1:70 亿参数开放权重图像模型,研究许可禁用商用
Qwen团队称其视觉生成组件仅 70 亿参数,在自家基准上超过多数闭源模型,但独立基准测试尚未出炉;模型可在 3090 等消费级GPU上运行,研究许可禁止商业使用。
AI解读:阿里Qwen团队发布了Qwen-Image-2.1,一个开放权重的图像生成与编辑模型。它最直接的卖点是体积:视觉生成部分只有 70 亿参数,却能在Qwen自己的基准上压过大多数闭源模型——注意,这是Qwen自家考的分数,独立评测还没出。
对想在本地跑图像生成的人来说,门槛降到了 3090 这类“还能买得起”的消费级显卡,不用租云端算力。真正干活的功能是原生的透明图层生成和编辑(RGBA),可以单独抠出物体、在透明层上改字;一次能接十张参考图,用来拼合照、虚拟试穿或做房间设计;局部修改靠画圈、涂蒙版或手绘标记来指。
卡住商用的一步是许可:研究许可明确禁止商业使用,企业要另外向Qwen申请商业授权。所以现在能拿来研究、做原型、个人玩,但别直接塞进要收费的产品里。模型已在Hugging Face、GitHub和Model Scope上线,Hugging Face上还有demo可试。
阿里Qwen AI团队发布了Qwen-Image-2.1,一个用于图像生成和编辑的开放权重模型。
据Qwen团队称,其视觉生成组件只有 70 亿参数,在Qwen自家基准上超过了大多数闭源模型;独立基准测试仍有待进行。
该模型可在 3090 等性能足够的消费级GPU上运行。
Qwen表示,这张合照是由每个人的单张照片组合而成。图片来源:Alibaba / Qwen。
模型原生支持生成和编辑透明图像(RGBA),允许用户隔离物体或修改透明层上的文字。
它一次最多可处理十张参考图像,用于合照、虚拟试穿或房间设计;圆圈、蒙版或涂画标记可引导局部编辑。
架构改动与KV缓存复用用于加速推理
Qwen表示,架构改动和KV缓存复用加快了推理速度,在多参考图像场景下尤其明显。
Qwen-Image-2.1已在Hugging Face、GitHub和Model Scope上提供,并配有Hugging Face demo。
研究许可禁止商业使用
其研究许可禁止商业使用,因此商业用户必须向Qwen申请单独的许可。