大数跨境

Qwen-Image-2.1:小巧、高效、统一的图像创作模型

Qwen-Image-2.1:小巧、高效、统一的图像创作模型 全球AI趋势
2026-09-21
17
导读:Qwen 家族开源了全新的图像模型 Qwen-Image-2.1,在生成质量、推理效率与成本之间取得了良好平衡

Qwen-Image-2.1 Banner

Qwen 家族开源了全新的图像模型 Qwen-Image-2.1,在生成质量、推理效率与成本之间取得了良好平衡。它将文生图与图像编辑统一到单一模型中,视觉生成组件仅含 70 亿(7B)参数,并原生支持透明图像的生成与编辑。

本次更新带来四大核心改进:

  • 紧凑高效:轻量级架构配合推理优化,兼顾画质与计算成本;

  • 原生透明、创作编辑一体:根据提示词直接生成普通或透明图像,可编辑透明图层,也能从照片中抠取主体;

  • 强大的编辑能力:支持最多 10 张参考图、局部区域编辑、人物与商品保真,覆盖广泛任务;

  • 真实质感与精致美学:排版、人像光影与细节全面提升,画面更具视觉冲击力。

01 / 紧凑而高效

Qwen-Image-2.1 采用轻量级架构,视觉生成组件由 32 层单流 DiT(Single-Stream DiT)和 70 亿参数构成。虽然体积小巧,生成质量却相当出色。下面的 Qwen-Image-Bench 对比展示了它与其他开源及闭源模型的表现。

Qwen-Image-Bench 模型对比结果

推理效率是另一个重点,尤其是在多图输入的编辑场景。这得益于混合粒度注意力架构:文本(系统前缀与编辑指令)使用 token 级因果掩码,图像生成则使用块级(chunk-level)掩码。同时,KV 缓存复用让输入图像和编辑指令作为静态上下文,在首步一次性计算并缓存,从而加速推理、降低显存占用。

推理效率对比:KV 缓存复用带来的加速

02 / 原生透明:创作与编辑一体

原生透明是本次发布的重要升级。2025 年 12 月发布的 Qwen-Image-Layered 是专门支持透明图像生成的模型,而 Qwen-Image-2.1 将这一能力整合进统一模型——由提示词决定输出普通图像还是带透明通道的图像。

以下是通过文字直接生成的透明图像示例:

文字直接生成的透明图像示例

除了单体素材,模型还能生成由多个元素组合而成的复杂透明图像,为设计与素材创作打开更多想象空间。

多元素组合的复杂透明图像

得益于生成与编辑的统一,Qwen-Image-2.1 可以直接编辑透明图像,例如在保留透明背景的前提下改变人物表情(左为输入,右为结果)。

透明图像表情编辑:输入与结果

透明图层中的文字同样可编辑。下面的例子将 "BLOOM" 替换为 "Qwen-Image"。

透明文字编辑:将 BLOOM 替换为 Qwen-Image

这一能力还延伸到真实照片:给定一张 RGB 图像,模型可以提取目标主体并输出带透明通道的 RGBA 图层,方便后续设计合成时复用素材。

从真实照片抠取主体生成 RGBA 透明图层

03 / 多才多艺的编辑能力

Qwen-Image-2.1 的编辑能力在四个方面得到提升:多参考图、局部编辑、保真性与任务覆盖面。

多参考图:最多支持 10 张输入图

模型支持最多 10 张参考图,可将多个主体与素材融合为连贯的画面。在下面的合影示例中,左侧六张单人肖像被合成到同一张照片中。

六张单人肖像合成为一张合影

虚拟试穿场景下,模特、服装、鞋子、包包与帽子共五张输入可组合为完整穿搭。

虚拟试穿:五张输入组合为完整穿搭

室内设计中,模型可用 10 张家具图生成完整的房间布局。

室内设计:10 张家具图生成完整房间布局

局部编辑:灵活的区域选择

Qwen-Image-2.1 支持圆圈标注、涂鸦标注和独立掩码三种方式来指定编辑区域。

第一个示例使用不同颜色的圆圈同时标记三个区域:“移除蓝色圆圈中的金属手表,将红色圆圈中的头发改为黑色,将绿色圆圈区域替换为灰色短袖亚麻睡衣。”(左为标注输入,右为结果。)

圆圈标注的局部编辑:标注输入与结果

涂鸦标注提供了另一种指定区域的方式。下例中,模型在输入图右侧白色标记区域内添加了一名潜水员。

涂鸦标注局部编辑:在标记区域添加潜水员

由于圆圈和涂鸦会遮挡原始内容,Qwen-Image-2.1 还支持将原图与独立掩码作为两个输入,完整保留原始画面。下面的示例使用这两张图让模型生成一位骑马的牛仔:

独立掩码输入:原图与掩码

模型只编辑掩码指定的区域,得到如下结果:

独立掩码编辑结果:骑马的牛仔

局部编辑还支持连续创作。通过在保留画面其余部分的同时逐步修改,编辑结果可以组装成简单的动画,比如博客中展示的水豚“葫芦兄弟”示例。

保真性:人物与商品的稳定还原

保真性提升聚焦于人物身份商品一致性。人像方面,模型更好地保持面部特征,使人物身份在编辑前后保持一致(每组左为输入,右为结果)。

人像保真示例一:输入与结果

商品编辑方面,模型力求保留文字、纹理与形状,让产品的关键特征在新画面中保持一致。

商品保真示例一:输入与结果

任务覆盖:全景图、信息图与分镜

Qwen-Image-2.1 支持全景图、信息图、分镜等广泛的编辑任务,在不同应用间均衡发力。例如,从一张自拍出发:

用于生成全景图的输入自拍

模型可以生成如下全景图,并可在可视化工具中浏览不同视角:

由自拍生成的全景图

信息图生成方面,一张模特照片可以扩展为细节丰富、信息量充足的构图。

由模特照片生成的复杂信息图

模型还能将三视图角色参考转化为完整分镜,为叙事与视觉创作提供素材。

由角色参考生成的完整分镜

04 / 真实质感与精致美学

Qwen-Image-2.1 进一步提升了视觉质量,尤其注重文字排版与人像。文字渲染不仅关注内容本身,还考虑字体风格、排版布局以及它们与整体构图的关系。

文字渲染示例一

人像方面,改进的光影处理与细节刻画让生成图像更加逼真。

人像光影与细节示例一

05 / 结语

凭借仅 7B 参数的视觉生成组件,Qwen-Image-2.1 将图像生成、透明能力与丰富的编辑功能汇聚于一身。更快的推理速度、最多 10 张参考图的支持、灵活的局部编辑,以及对人物与商品的更高保真度,使其成为设计、内容创作、电商与视觉叙事领域的实用工具。

祝大家创作愉快!模型已在 GitHubHugging Face 和 ModelScope 开源。

【声明】内容源于网络
0
0
全球AI趋势
每日推送全球AI资讯
内容 36
粉丝 0
全球AI趋势 每日推送全球AI资讯
总阅读14
粉丝0
内容36