跳到主内容
vision阿里云通义千问

Qwen-Image-2.1

阿里通义千问 Qwen-Image-2.1 详解:7B(7.1B DiT)开源权重,生成与编辑合一,原生 RGBA 透明输出,单次最多 10 张参考图,默认 2K 出图。Day-0 支持 ComfyUI / Diffusers / vLLM-Omni / SGLang,RTX 4090 上 1024×1024 约 18.7 秒。采用 Qwen 研究许可,商用需另议。

发布 2026-09-21更新 2026-09-21核实 2026-09-21

规格

厂商
阿里云通义千问
发布日期
2026/9/20
类型
vision
定价
权重免费(Qwen 研究许可,商用需单独授权)
API 兼容
openai

基准测试

约 18.7 秒
1024×1024 生成(RTX 4090 24GB + CPU offload)
约 21.7 秒
图像编辑(同上环境)
2048×2048 / 40 steps
默认分辨率 / 步数
10 张
参考图上限

优势

  • 生成与编辑共用一个 7B checkpoint,无需切换模型
  • 原生 RGBA 透明输出,免抠图 / 免 matting 节点
  • 单次最多 10 张参考图,可做合照、穿搭、空间搭配
  • 默认 2K(2048×2048)出图,消费级显卡可跑
  • Day-0 支持 ComfyUI / Diffusers / vLLM-Omni / SGLang-Diffusion / LightX2V

不足

  • Qwen 研究许可,禁止商用,商用须单独申请授权
  • 官方称超越多数闭源模型,但独立第三方基准尚缺
  • 官方未公布完整吞吐/延迟数据表,性能多数来自社区实测
  • 透明通道与多图编辑对显存更敏感,低显存需 CPU offload

适用场景

需要透明背景的素材:sprite、Logo、图标、商品抠图多主体合成:合照、虚拟试穿、室内软装搭配局部精确修改:圈选 / 涂鸦 / 蒙版指定区域本地或私有化部署的图像生成与编辑流水线

2026-09-20 发布:阿里 Qwen 团队于 2026-09-20 在 Hugging Face、GitHub 与 ModelScope 同步放出 Qwen-Image-2.1 权重。这是距 2026 年 2 月 Qwen-Image 2.0 之后约七个月的迭代,核心变化是透明通道内置多参考图编辑

概述

Qwen-Image-2.1 是阿里通义千问团队的统一图像模型——同一个 7B checkpoint 同时做文生图和图像编辑。视觉生成部分为 7B 参数(官方技术描述为 7.1B DiT),由 32 层 Single-Stream DiT 构成。

它最值得关注的三点是:

  1. 原生 RGBA:透明背景由模型内部处理,不再需要「先生成再抠图」的两段式流程。
  2. 最多 10 张参考图:一次前向里合并多个主体,做合照、穿搭、家具摆放成为可能。
  3. 默认 2K:2048×2048 输出、40 步推理,仍是消费级显卡能扛的量级。

AI 之家 观点:7B 只是个参数数字,真正的意义是门槛——一个默认出 2K、能出透明通道、能吃 10 张参考图的模型,跑在一张消费级显卡上。对做素材流水线、电商图、设计工具的团队,这比又一个「SOTA 闭源」有实用价值得多。唯一要盯紧的是许可:它叫「开源」,但贴的是研究许可。

架构要点

组件规格
视觉生成主干7.1B 参数 DiT,32 层 Single-Stream
文本编码器Qwen3-VL-8B(把指令与条件图折叠进同一表示)
VAE64 通道 RGBA 自编码器,16× 空间压缩
采样器Flow matching + Euler discrete,动态 shift
默认输出2048×2048,40 步,7 种推荐画幅(最大 2752×1536)

速度上的收益主要来自注意力层的设计:文本用 token 级因果掩码,图像生成用 chunk 级掩码,两种粒度混用;同时输入图与编辑指令只在第一步计算,之后每步复用缓存。官方称这一设计在多图编辑时提升最明显,显存占用也更低。

三项核心能力

1. 原生透明通道

Qwen 在 2025 年 12 月曾单独发过透明图模型 Qwen-Image-Layered,这次把能力并进了主模型——由 prompt 决定是否输出 alpha 通道

实际效果是:给一张照片,可以把指定主体直接抠成 RGBA 图层;同一个 checkpoint 还能在保持透明背景的前提下改人脸表情、替换文字图层里的字。ComfyUI 在发布当天的说明里写得很直接:sprite、Logo、图标、商品抠图从采样器出来就能直接合成,不再需要背景去除节点、matting 模型或边缘清理,并称「没有其他主流开源模型做到这一点」。

2. 最多 10 张参考图

参考图槽位在填第一张后会再开一个,最多 10 个。典型用法:

  • 6 张单人照 → 1 张合照
  • 模特 / 上衣 / 鞋 / 包 / 帽子 → 完整穿搭
  • 10 件家具 → 一个房间的布置

3. 四种局部编辑把手

  • 彩色圆圈 / 涂鸦标注:圈出要改的区域
  • 独立蒙版:原图必须保持不被遮挡时,图像与蒙版作为两个输入送入
  • 指令编辑:自然语言描述改动
  • 文字层替换:替换图层内的文字

全景图、信息图、分镜也在官方支持的任务清单里。

部署与生态(Day-0)

框架 / 平台支持内容
DiffusersQwenImage21Pipeline
ComfyUI首发即带 alpha 通道工作流
vLLM-OmniFP8 量化、分步执行
SGLang-Diffusionprefix caching、多卡并行
LightX2V预置镜像与权重
AMD ROCm / FlagOS非 NVIDIA 路径,FlagOS 提供 8 种芯片平台的预置镜像

此外还随模型发布了两枚 Qwen3.5-VL 9B 微调模型,专门用于短 prompt 扩写(文生图一枚、编辑一枚)。

性能参考

SGLang 团队公布的数据(单张 RTX 4090 24GB + CPU offload):

任务耗时
1024×1024 生成18.7 秒
图像编辑21.7 秒

Qwen 官方称该模型在自家基准上超过多数闭源图像模型,但独立第三方基准截至发稿仍缺——这个结论应视为起点而非定论。

许可:这是最大的坑

权重采用 Qwen Research License Agreement,允许研究与非商业用途商业使用需与 Qwen 单独签署授权

官方公告里用了 "open source" 的说法,但随权重附的是研究许可,不是 Apache-2.0 这类宽松许可。任何打算把它放进商业产品的团队,必须先谈授权——这一点在选型阶段就要确认,不要等集成完了才发现。

快速上手

from diffusers import QwenImage21Pipeline
import torch

pipe = QwenImage21Pipeline.from_pretrained(
    "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")

# 1) 文生图(默认 2K)
image = pipe(prompt="一只戴着飞行护目镜的橘猫,透明背景").images[0]
image.save("cat_rgba.png")   # 直接带 alpha 通道

# 2) 多参考图编辑:最多 10 张
refs = ["p1.png", "p2.png", "p3.png"]
edited = pipe(
    prompt="把这三个人合成一张户外合影,光线统一为傍晚",
    image=[Image.open(p) for p in refs],
).images[0]
edited.save("group.png")
# ComfyUI:直接拉官方工作流,alpha 通道节点已内置
git clone https://github.com/QwenLM/Qwen-Image-2.1

避坑清单

  • 商用前先谈授权:研究许可不等于能上线赚钱,别在 POC 阶段忽略。
  • 别信单一来源的跑分:官方「超越闭源」的结论基于自有基准,独立复现出来之前保持保留。
  • 显存要有余量:透明通道与 10 图参考对显存更敏感,24GB 以下建议开 CPU offload 或降分辨率。
  • 回调原文:多参考图合并时主体归属偶有偏差,商用素材务必人工过一遍。

FAQ

Q:Qwen-Image-2.1 能商用吗? A:不能直接商用。权重采用 Qwen 研究许可,仅限研究与非商业用途。商业部署需向 Qwen 申请单独授权,官方未公布授权价格。

Q:和上一代 Qwen-Image 2.0 有什么区别? A:2.0 发布于 2026 年 2 月。2.1 把透明图能力(原属独立的 Qwen-Image-Layered)并进主模型,把参考图上限提到 10 张,并统一了生成与编辑两条路径。

Q:需要什么显卡? A:官方称可在 RTX 3090 及以上消费级显卡运行。SGLang 实测 RTX 4090 24GB 配合 CPU offload 生成 1024×1024 约 18.7 秒;显存更小时建议降分辨率或加强 offload。

Q:有没有 hosted API 版本? A:有。此前数周 Qwen 已上线闭源的 Qwen-Image 3.0 托管服务;这次的 2.1 是权重可下载的对应版本,能力侧重不同。

延伸阅读

来源

核对日期:2026-09-21。商用授权价格、官方完整吞吐数据表两项待核实

相关工具

相关对比

Alice vs Flowith:桌面快捷键助手 vs 画布工作空间(2026 实测选型)

Alice vs Flowith 2026 选型对比:heyalice.app 全局快捷键桌面助手(BYO API + 一次买断) vs 新加坡无限画布 AI 工作空间(Agent Neo 10M 上下文 + Knowledge Garden)。从定位、核心能力、模型支持、价格、国内可用性 6 个维度帮你选对 AI Agent。

Claude Desktop vs Flowith:AI Agent 怎么选?2026 对比

Claude Desktop vs Flowith 2026 选型对比:Anthropic 官方桌面客户端(原生 MCP + .mcpb 扩展) vs 新加坡画布式 AI 工作空间(Agent Neo 10M 上下文 + Knowledge Garden)。从定位、核心能力、模型支持、价格、国内可用性、适用场景 6 个维度帮你选对 AI Agent。

Cursor vs v0:AI 编程 IDE vs AI 前端生成器怎么选?

Cursor vs v0 2026 选型对比:Anysphere 的 AI 原生 IDE vs Vercel 的 AI 前端组件生成器。从定位、工作流、输出物、价格、适合人群 6 个维度帮你选对工具:全栈工程选 Cursor,快速 UI 原型选 v0。

Flowith vs Genspark:AI Agent 怎么选?2026 对比

Flowith vs Genspark 2026 选型对比:无限画布 + 10M token 上下文的 Flowith vs 多 Agent 架构 + Sparkpage 全栈输出的 Genspark。从定位、核心能力、模型支持、价格、国内可用性和适用场景 6 个维度帮你选对 AI Agent。

Lovable vs v0:AI 应用生成器 vs 前端组件生成器怎么选?

Lovable vs v0 2026 选型对比:全栈应用生成器(Supabase 后端一体化)vs Vercel 前端组件生成器(React+shadcn/ui)。从生成范围、后端能力、部署、价格和适合人群帮你选对 AI 生成工具。

v0 vs Bolt.new:AI 前端生成工具怎么选(2026)

v0 与 Bolt.new 都能用自然语言生成前端应用。一句话结论 + 决策树 + 价格对比:要组件级产出与设计系统一致性选 v0,要全栈跑通与浏览器内开发选 Bolt.new。