通义千问开源 Qwen-Image-2.1:7B 参数实现文生图与图像编辑一体化

9月21日,通义千问团队正式开源新一代图像模型 Qwen-Image-2.1。该模型以仅7B 参数的轻量视觉生成模块,将文生图、透明图像生成与多种图像编辑能力整合于同一框架,在生成效果、推理效率与使用成本之间取得了新的平衡。

9月21日,通义千问团队正式开源新一代图像模型 Qwen-Image-2.1。该模型以仅7B 参数的轻量视觉生成模块,将文生图、透明图像生成与多种图像编辑能力整合于同一框架,在生成效果、推理效率与使用成本之间取得了新的平衡。

据官方介绍,Qwen-Image-2.1的视觉生成部分采用32层 Single-Stream DiT 结构,参数量仅为7B。通过混合粒度注意力结构与 KV Cache 复用机制,模型在多图输入场景下的推理效率显著提升,显存开销也得到有效控制。

透明图像生成是本次更新的核心亮点之一。模型能够根据提示词自动判断输出普通图像或带透明通道的 RGBA 图像,并支持在保留透明背景的前提下进行主体表情修改、文字编辑等操作。用户还可输入真实照片,由模型自动提取主体并输出透明图层,方便后续设计与合成。

可以在保留透明背景的同时修改主体表情

透明图层中的文字同样可以进行编辑,如下面的示例将文字“BLOOM”修改为“Qwen-Image”:

在图像编辑方面,Qwen-Image-2.1支持最多10张参考图输入,可综合多个主体与素材生成协调画面。局部编辑支持圈选、涂抹和独立掩码三种方式,编辑区域指定更加灵活。模型还重点提升了人像与商品的一致性——修图后人物面部特征、商品文字与形态均能保持高度还原。

此外,模型在文字渲染、人物光影与细节刻画上也有明显提升,覆盖全景图、信息图、分镜图等多种任务场景。目前,Qwen-Image-2.1已同步在 GitHub、ModelScope 和 Hugging Face 等平台开源,供开发者与创作者免费使用。

CXOU AI 未来大会 · 报名通道限时开启
💬 评论
🔗 本文链接

📰 你可能也喜欢

数智化转型网每日AI资讯 资讯

用《我的世界》测 GPT-6 Astra:141 小时直播,一只苦力怕让 AI 陷入“种土豆”循环

AI 评测机构 Vals AI 利用游戏《我的世界(Minecraft)》对 OpenAI 最新大模型 GPT-6 Astra 开展长时自主游戏测试,全程在 T…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

ZCode 道歉并开源:阿里云 OSS 已清空,Repo Wiki 功能已下线

近日,针对社区反馈的 ZCode 产品安全问题,ZCode 团队正式发布公开致歉与整改说明,宣布已将代码在 GitHub 上开源(github.com/zai-…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

Gemini 也"越狱"了:谷歌确认 5 月安全测试中闯入 3 家真实公司系统,同一家评估商的锅

谷歌在9月18日(周五)亲手确认了一桩尴尬事:旗下 Gemini 模型在一次测试中访问了3家外部公司的系统。《华尔街日报》最早披露了这些发生在今年5月的事件。
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

微软Copilot桌面版新增内置浏览器,支持多标签与全屏浏览

微软正在为Windows和macOS版Copilot桌面应用测试内置并排网页浏览器,允许用户直接在Copilot会话右侧打开网页,并支持多标签导航和全屏切换,以…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 资讯

TypeSafe AI 推出决策专用模型 Jev:比大语言模型快 10 倍、成本仅十分之一

旧金山初创公司 TypeSafe AI 近日发布了一款名为 Jev 的新型 AI 模型。与传统大语言模型不同,Jev 专门用于回答是 / 否问题以及多项选择题,…
📅 09-23 · 👁 2026年9月23日
数智化转型网每日AI资讯 AI新闻资讯

黄仁勋驳斥 AI 末日叙事:吓唬人不负责任,2030 年是世界末日概率为 0%

英伟达联合创始人兼首席执行官黄仁勋昨日接受 CBS News 采访时表示,他不认同某些研究员提出的“AI 可能在几年内灭绝人类”的说法。他认为这类说法属于被过度…
📅 09-23 · 👁 2026年9月23日