今日分析

AI 新闻里的变化、生意与判断。

011AI 图像 / 开源模型

Qwen 把生图、修图和透明图塞进一个 7B 模型

Qwen-Image-2.1 于 9 月 20 日开源,视觉生成组件为 7B 参数,支持文生图、图像编辑、透明 RGBA 输出、最多 10 张参考图和局部蒙版编辑。商用要先申请单独授权。

AI 生成示意图、非事件现场、非产品界面:用设计工作台表现透明素材的生成、编辑和整理,不对应 Qwen 的实际软件界面。
点击图片放大
01

这次更新,参数不大,事情做得更全

通义团队 9 月 20 日发布 Qwen-Image-2.1,并同步开放模型权重和代码。模型的视觉生成组件有 7B 参数,采用 32 层单流 DiT 架构,原生支持 2K 图像。官方把它定位成一个同时做文生图和图像编辑的模型。

它能接最多 10 张参考图,也能用圆圈、涂抹标记或单独的蒙版指定修改区域。人物和商品的一致性被列为重点:换衣服、换背景、合成多个商品时,尽量保留脸、形状、纹理和文字。

02

透明背景,才是这次最容易落地的功能

Qwen-Image-2.1 可以直接生成带透明通道的 RGBA 图片,也可以编辑已经有透明背景的素材。给一张普通照片,它还能把主体提取出来,交付成可继续排版的透明图层。

这件事听上去有点琐碎,却正好击中了设计流程里最烦的一段:生成图片之后,还得抠主体、清边、改局部、保留商品细节,再导入海报、电商主图或视频。以前这些动作分散在不同软件里,模型现在把它们放到了一条指令里。

Qwen 的官方示例还展示了透明素材里的文字替换、人物表情修改,以及把多张人物、服装和家具参考图合成到一个场景。示例是厂商自测,不能直接当成所有图片都能稳定复现的效果。

03

对做内容的人,变化在交付速度

一个电商团队可以先生成一组商品场景,再保留商品主体去换背景;一个做短视频的人可以把角色、道具和字幕拆成透明素材,后面反复组合;设计师也可以用多张参考图先搭出草稿,再只修改圈出来的部分。

这些用法不等于模型会替设计师做完方案。审美判断、品牌规范、版权确认和最后的细节修整仍然在人手里。模型减少的是来回切软件、重复抠图和重新生成整张图的次数。

04

开源两个字后面,有一条容易漏看的限制

Qwen-Image-2.1 使用的是 Qwen Research License。协议把使用、复制和修改的免费范围限定在研究或评估等非商业用途;如果把模型用于商业产品或服务,需要向 Qwen 申请单独的商业授权。

这意味着个人试用、内部评估和研究可以先跑起来,接客户项目、做在线生图服务或把模型放进收费产品之前,要先处理授权。模型权重开放下载,不等于商业使用没有条件。

未来 3—6 个月 · 待核查问题

接下来怎么看

一条模型发布还不足以改写设计行业。它把透明素材制作放进了基础模型的能力范围,影响能否扩大,要看三件事:商用授权是否清楚、本地运行的显存和速度是否能被普通团队接受,以及它在真实商品图和中文文字上的稳定性。

持续检查:ComfyUI、Diffusers 等工具的实际工作流是否成熟;设计团队是否把它用于批量商品素材;授权价格和条款是否公开;人物和商品一致性在真实项目中能否保持。

往期分析

GPT-6 Luna 每百万输入 0.1 美元,模型价格战开始算“每个任务”

这次发布的重点,是大模型开始按任务经济学竞争。标价降下来之后,缓存命中率、工具调用次数、失败重跑和人工复核,才决定一条 Agent 流程贵不贵。

小米这次开源的,已经不只是模型权重

开源模型的竞争开始往后移:权重只是起点,任务环境、奖励评估和训练工具决定别人能不能继续把模型做强。小米这次把一部分训练机器放出来,价值比再报一个榜单名次更大。

审计还没开始,AI先把工具造出来了

AI 在安全审计里的先手,可能是先把缺的工具补齐。工具能复用,审计才会越做越快;只让 Agent 对着代码找漏洞,收益没那么稳定。

GitHub 用 Copilot 重写 83 万行 Rust,重点在于它没让 Agent 一次写完

这次迁移说明,Agent 可以承担大块代码搬运,交付靠的是分片、测试和持续审查。把任务丢给 Agent 等结果,撑不起 83 万行生产代码。

OpenAI 开始公开模型失准,最麻烦的是它会自作主张

OpenAI 这次公开的重点,不在于证明模型已经失控,而在于承认异常行为可能在修复前就该留下记录。对使用 Agent 的团队,任务摘要、工具权限和外部写入都不能只当作普通文本。

Siri AI 终于能替你办事,但中国用户暂时用不了

这次 Siri 更新的分量,在于它开始替用户跨应用办事:读消息、找邮件、看屏幕,再写信、建日程或整理清单。可惜中国首发不在名单里,短期能不能用,先看监管和本地化进度。

小红书开源 Iris,榜单分数要连 Harness 一起看

这次发布最有价值的地方,是把模型和 Harness 拆开报分。做搜索 Agent 时,工具、上下文丢弃、重试和评分器都会改结果;只截一行最高分,信息不完整。

长任务 Agent 会忘事,先别急着换模型

模型窗口再大,也装不下无限的工具结果。能否把旧信息放到可检索的位置,压缩后找回目标,并在出错时继续执行,决定了长任务能不能交付。

GitHub 把营销工作塞进 Issue,Copilot 负责起草,人仍要签字

这篇文章最有用的一点,是把 Copilot 放回流程里看:它起草名称和邮件,Issue、标签、Actions 负责执行,负责人继续签字。流程写不清,换模型也不会自动变好。

Claude 被用于导弹软件,Anthropic 没有说明何时发现

封禁账号可以停止后续调用,却无法收回已经写出的代码。判断平台是否及时干预,需要知道首次异常请求、人工调查和封号之间隔了多久。

DeepSeek V4.1 Flash:长任务 Agent 的成本账

缓存压缩降低了长任务的资源负担,能否转化成利润仍取决于复用比例和交付质量。值得优先试点的,是输入重复度高、结果可核验、出错后能恢复的流程。

AI 客服降本 65% 的案例里,真正值得重算的是哪笔账

AI 客服的价值要以问题解决后的总成本衡量。重复咨询减少后,人工会更集中地处理复杂工单;能否减少重复来单、控制错误操作并持续维护业务规则,比自动处理率更影响利润。