大数跨境

阿里开源的 Qwen-Image 2.1:能直接吐出透明图层,但许可证这次收紧了

阿里开源的 Qwen-Image 2.1:能直接吐出透明图层,但许可证这次收紧了 路过银河AI
2026-09-21
1
导读:阿里开源的 Qwen-Image 2.1:能直接吐出透明图层,但许可证这次收紧了做过电商主图、表情包、Ap

阿里开源 Qwen-Image 2.1:原生透明图层与许可证收紧

电商主图、表情包及 App 图标制作常面临繁琐的后期抠图流程。9 月 20 日,阿里 Qwen 团队开源 Qwen-Image 2.1,将透明通道生成直接内置于模型推理阶段,实现生成即带 Alpha 通道的 PNG 图像。然而,在部署与商用前,需厘清关于该模型的三个关键误区。

一、纠正三个常见误读

误读一:"这是 Qwen-Image 2.0 的迭代开源"

事实:2.0 从未开源。Qwen-Image 2.0 于 2026 年 2 月发布,仅提供 API 或 Chat 服务,未公开权重。此外,性能更强的 Qwen-Image 3.0 系列(2026 年 7 月上线)同样闭源。准确定位是:2.1 是该系列首个开源权重版本,属于“次旗舰开源、旗舰闭源”策略下的产物。

误读二:"透明输出目前无其他主流开源模型能做到"

事实:技术并非独有,优势在于“原生集成”。LayerDiffuse 早在 2024 年已实现隐空间透明度生成,通义 Qwen-Image-Layered 及 Stability 的 Stable Layers 也支持多图层输出。Qwen-Image 2.1 的核心突破在于将“文本直出 RGBA"与“生成 + 编辑”能力整合进同一套 7B 开源权重,无需串联额外去背节点或后处理模型。

误读三:"7B 参数可轻松塞进消费级显卡"

事实:真实门槛为 7B 主干 + 8B 文本编码器。完整运行需加载视觉生成主干、文本编码器及 VAE。实测体积如下:

组件 规格 体积(实测)
视觉生成主干 32 层单流 DiT,7.1B 参数 bf16 13.25 GB / int8 6.76 GB
文本编码器 Qwen3-VL 8B bf16 16.33 GB / int8 8.71 GB / w4a8 5.88 GB
VAE RGBA 自编码器 0.63 GB
提示词改写(建议) Qwen3.5-VL 9B 微调 另计

典型组合显存占用:

  • 最小量化组合(int8 主干 + w4a8 编码器 + VAE):约 13.3 GB
  • ComfyUI 默认组合(int8 主干 + bf16 编码器 + VAE):约 23.7 GB
  • 全 bf16 组合:约 30.2 GB

官方文档未明确标注显存需求,仅建议开启 CPU offload,因此"7B 上消费卡”的说法具有误导性。

二、核心技术:将 Alpha 通道植入 VAE

Qwen-Image 2.1 的技术价值在于架构创新,其核心差异体现在 VAE 设计:

组件 官方规格 直白解释
主干 32 层单流 DiT,7.1B 参数,block-causal 注意力 文本与图像 token 同流处理
文本编码器 Qwen3-VL 8B 视觉语言模型 统一编码文字指令与参考图
VAE 输入/输出均为 4 通道,隐空间 64 通道 透明能力的根源
调度器 Flow Matching + Euler 离散调度 + 动态偏移 采样策略优化

绝大多数图像模型 VAE 仅编码 RGB 三通道,而该模型自编码器原生支持 4 通道(RGBA)。这意味着 Alpha 通道是在去噪每一步中同步预测的,而非生成后贴图。此外,采用 single-stream DiT(单流)架构,配合 block-causal 注意力与 prefix KV 缓存复用,显著降低了多参考图编辑的算力消耗。

三、四大官方升级特性

1. 原生透明与生成编辑统一

单一模型支持从文本生成 RGBA 图像、编辑现有透明图层及照片主体提取。需注意提示词格式,必须明确包含透明意图描述,否则可能输出白底图:

This is an RGBA image with transparency. A cute cartoon dragon sticker.
The image has alpha channel and the background is transparent.

2. 多参考图编辑

官方宣称支持最多 10 张参考图,ComfyUI 节点实际开放 16 个槽位(image_1 至 image_16)。支持圈选、手绘标注及独立掩码图三种局部修改方式,强调保持人物与产品身份一致性。

3. 紧凑高效

通过 7.1B 主干、混合粒度注意力机制及 prefix KV 缓存复用,优化显存占用与计算效率。

4. 质感与美学提升

重点改进排版、人像光照及细节渲染,延续 Qwen-Image 系列在文字渲染方面的优势。

四、规格参数与依赖环境

官方默认分辨率为 2048×2048(原生 2K 生成),推荐采样步数为 40 步。支持多种宽高比:

比例 分辨率
1:1 2048 × 2048(默认)
4:3 / 3:4 2400 × 1792 / 1792 × 2400
3:2 / 2:3 2528 × 1696 / 1696 × 2528
16:9 / 9:16 2752 × 1536 / 1536 × 2752

环境依赖:

pip install torch>=2.4.0
pip install transformers>=5.17
pip install git+https://github.com/huggingface/diffusers
pip install accelerate pillow

五、ComfyUI 部署指南

ComfyUI 模板已内置支持,需下载以下三个核心文件至对应目录:

目录 文件名 体积
models/diffusion_models/ qwen_image_2.1_int8_convrot.safetensors 6.76 GB
models/text_encoders/ qwen3vl_8b_int8_convrot.safetensors 8.71 GB
models/vae/ qwen_image_2.1_vae_bf16.safetensors 0.63 GB

注意:ComfyUI 模板默认参数为 25 步、CFG 1、Euler 调度器。分辨率选择器以“百万像素”为单位,设置 2048×2048 需将目标设为约 4.0 MP。

六、关键依赖:提示词改写模型

官方明确指出,不使用提示词改写可能导致编辑结果不稳定。为此发布了两个基于 Qwen3.5-VL 9B 微调的专用模型:

  • 文生图:Qwen/Qwen-Image-2.1-PE-T2I
  • 图像编辑:Qwen/Qwen-Image-2.1-PE-I2I

建议在 ComfyUI 工作流中接入改写模型,而非直接使用简短提示词,以获得最佳效果。

七、许可证变更:从 Apache-2.0 到限制商用

本次开源采用Qwen Research License Agreement,相较于初代版本的 Apache-2.0 协议,权限大幅收紧:

  1. 仅限非商业用途:定义为仅用于研究或评估(research or evaluation purposes only)。
  2. 商用需单独授权:商业使用必须向官方申请。
  3. 衍生模型标注义务:若利用其输出训练或微调新模型,需在文档显著位置标注"Built with Qwen"或"Improved using Qwen"。
  4. 法律管辖:适用中国法律,管辖法院为杭州市法院。

风险提示:协议约束的是“使用模型”的行为,利用 2.1 生成的图片进行商业物料制作同样受限。此外,ComfyUI 社区仓库(Comfy-Org)标注的 apache-2.0 许可证与上游不一致,不可作为商用依据。

八、客观评测与局限

  1. 榜单参考性:官方自评榜得分 60.28,暂未进入主流第三方竞技场榜单,缺乏独立横向评测。
  2. 多参考图边界:实测显示参考图超过 2 张易出现角色串味、特征污染等问题。建议作为"2 张主参考 + 若干氛围参考”使用。
  3. 速度数据缺失:官方未公布延迟数据,社区粗略预估文生图 10–15 秒/张,仅供参考。
  4. 低显存适配:12GB 显存显卡需开启 CPU offload,速度将明显下降。
  5. 稳定性:模型发布时间短,潜在 Bug 尚未完全暴露。

九、模型获取与部署

以下为 ComfyUI 可直接使用的最小可用组合(约 22 GB),文件目录结构已与官方模板对齐:

目录 文件名 体积
models/diffusion_models/ qwen_image_2.1_int8_convrot.safetensors 6.76 GB
models/text_encoders/ qwen3vl_8b_int8_convrot.safetensors 8.71 GB
models/text_encoders/ qwen3vl_8b_w4a8.safetensors(省显存备选) 5.88 GB
models/vae/ qwen_image_2.1_vae_bf16.safetensors 0.63 GB

高质量 bf16 版本正在补传中。国内用户建议通过魔搭(ModelScope)下载,速度更优:

  • ComfyUI 打包版:Comfy-Org/Qwen-Image-2.1
  • 原始仓(diffusers 格式):Qwen/Qwen-Image-2.1

结语

图像生成竞争已进入“直接产出可用素材”的第三阶段。Qwen-Image 2.1 通过原生透明通道、多参考图编辑及提示词改写模型,有效削减了后期手工环节。然而,其也反映了国产大模型的新常态:最强能力保留在闭源端,开源版本多为次旗舰且许可证日益严格。对于使用者而言,下载前仔细研读 LICENSE 条款比关注跑分更为重要。

【声明】内容源于网络
0
0
路过银河AI
1234
内容 1076
粉丝 1
路过银河AI 1234
总阅读36.5k
粉丝1
内容1.1k