Qwen-Image-2.1
阿里通义千问 Qwen-Image-2.1 详解:7B(7.1B DiT)开源权重,生成与编辑合一,原生 RGBA 透明输出,单次最多 10 张参考图,默认 2K 出图。Day-0 支持 ComfyUI / Diffusers / vLLM-Omni / SGLang,RTX 4090 上 1024×1024 约 18.7 秒。采用 Qwen 研究许可,商用需另议。
发布 2026-09-21更新 2026-09-21核实 2026-09-21规格
- 厂商
- 阿里云通义千问
- 发布日期
- 2026/9/20
- 类型
- vision
- 定价
- 权重免费(Qwen 研究许可,商用需单独授权)
- API 兼容
- openai
基准测试
优势
- •生成与编辑共用一个 7B checkpoint,无需切换模型
- •原生 RGBA 透明输出,免抠图 / 免 matting 节点
- •单次最多 10 张参考图,可做合照、穿搭、空间搭配
- •默认 2K(2048×2048)出图,消费级显卡可跑
- •Day-0 支持 ComfyUI / Diffusers / vLLM-Omni / SGLang-Diffusion / LightX2V
不足
- •Qwen 研究许可,禁止商用,商用须单独申请授权
- •官方称超越多数闭源模型,但独立第三方基准尚缺
- •官方未公布完整吞吐/延迟数据表,性能多数来自社区实测
- •透明通道与多图编辑对显存更敏感,低显存需 CPU offload
适用场景
2026-09-20 发布:阿里 Qwen 团队于 2026-09-20 在 Hugging Face、GitHub 与 ModelScope 同步放出 Qwen-Image-2.1 权重。这是距 2026 年 2 月 Qwen-Image 2.0 之后约七个月的迭代,核心变化是透明通道内置与多参考图编辑。
概述
Qwen-Image-2.1 是阿里通义千问团队的统一图像模型——同一个 7B checkpoint 同时做文生图和图像编辑。视觉生成部分为 7B 参数(官方技术描述为 7.1B DiT),由 32 层 Single-Stream DiT 构成。
它最值得关注的三点是:
- 原生 RGBA:透明背景由模型内部处理,不再需要「先生成再抠图」的两段式流程。
- 最多 10 张参考图:一次前向里合并多个主体,做合照、穿搭、家具摆放成为可能。
- 默认 2K:2048×2048 输出、40 步推理,仍是消费级显卡能扛的量级。
AI 之家 观点:7B 只是个参数数字,真正的意义是门槛——一个默认出 2K、能出透明通道、能吃 10 张参考图的模型,跑在一张消费级显卡上。对做素材流水线、电商图、设计工具的团队,这比又一个「SOTA 闭源」有实用价值得多。唯一要盯紧的是许可:它叫「开源」,但贴的是研究许可。
架构要点
| 组件 | 规格 |
|---|---|
| 视觉生成主干 | 7.1B 参数 DiT,32 层 Single-Stream |
| 文本编码器 | Qwen3-VL-8B(把指令与条件图折叠进同一表示) |
| VAE | 64 通道 RGBA 自编码器,16× 空间压缩 |
| 采样器 | Flow matching + Euler discrete,动态 shift |
| 默认输出 | 2048×2048,40 步,7 种推荐画幅(最大 2752×1536) |
速度上的收益主要来自注意力层的设计:文本用 token 级因果掩码,图像生成用 chunk 级掩码,两种粒度混用;同时输入图与编辑指令只在第一步计算,之后每步复用缓存。官方称这一设计在多图编辑时提升最明显,显存占用也更低。
三项核心能力
1. 原生透明通道
Qwen 在 2025 年 12 月曾单独发过透明图模型 Qwen-Image-Layered,这次把能力并进了主模型——由 prompt 决定是否输出 alpha 通道。
实际效果是:给一张照片,可以把指定主体直接抠成 RGBA 图层;同一个 checkpoint 还能在保持透明背景的前提下改人脸表情、替换文字图层里的字。ComfyUI 在发布当天的说明里写得很直接:sprite、Logo、图标、商品抠图从采样器出来就能直接合成,不再需要背景去除节点、matting 模型或边缘清理,并称「没有其他主流开源模型做到这一点」。
2. 最多 10 张参考图
参考图槽位在填第一张后会再开一个,最多 10 个。典型用法:
- 6 张单人照 → 1 张合照
- 模特 / 上衣 / 鞋 / 包 / 帽子 → 完整穿搭
- 10 件家具 → 一个房间的布置
3. 四种局部编辑把手
- 彩色圆圈 / 涂鸦标注:圈出要改的区域
- 独立蒙版:原图必须保持不被遮挡时,图像与蒙版作为两个输入送入
- 指令编辑:自然语言描述改动
- 文字层替换:替换图层内的文字
全景图、信息图、分镜也在官方支持的任务清单里。
部署与生态(Day-0)
| 框架 / 平台 | 支持内容 |
|---|---|
| Diffusers | QwenImage21Pipeline |
| ComfyUI | 首发即带 alpha 通道工作流 |
| vLLM-Omni | FP8 量化、分步执行 |
| SGLang-Diffusion | prefix caching、多卡并行 |
| LightX2V | 预置镜像与权重 |
| AMD ROCm / FlagOS | 非 NVIDIA 路径,FlagOS 提供 8 种芯片平台的预置镜像 |
此外还随模型发布了两枚 Qwen3.5-VL 9B 微调模型,专门用于短 prompt 扩写(文生图一枚、编辑一枚)。
性能参考
SGLang 团队公布的数据(单张 RTX 4090 24GB + CPU offload):
| 任务 | 耗时 |
|---|---|
| 1024×1024 生成 | 约 18.7 秒 |
| 图像编辑 | 约 21.7 秒 |
Qwen 官方称该模型在自家基准上超过多数闭源图像模型,但独立第三方基准截至发稿仍缺——这个结论应视为起点而非定论。
许可:这是最大的坑
权重采用 Qwen Research License Agreement,允许研究与非商业用途,商业使用需与 Qwen 单独签署授权。
官方公告里用了 "open source" 的说法,但随权重附的是研究许可,不是 Apache-2.0 这类宽松许可。任何打算把它放进商业产品的团队,必须先谈授权——这一点在选型阶段就要确认,不要等集成完了才发现。
快速上手
from diffusers import QwenImage21Pipeline
import torch
pipe = QwenImage21Pipeline.from_pretrained(
"Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16
).to("cuda")
# 1) 文生图(默认 2K)
image = pipe(prompt="一只戴着飞行护目镜的橘猫,透明背景").images[0]
image.save("cat_rgba.png") # 直接带 alpha 通道
# 2) 多参考图编辑:最多 10 张
refs = ["p1.png", "p2.png", "p3.png"]
edited = pipe(
prompt="把这三个人合成一张户外合影,光线统一为傍晚",
image=[Image.open(p) for p in refs],
).images[0]
edited.save("group.png")
# ComfyUI:直接拉官方工作流,alpha 通道节点已内置
git clone https://github.com/QwenLM/Qwen-Image-2.1
避坑清单
- 商用前先谈授权:研究许可不等于能上线赚钱,别在 POC 阶段忽略。
- 别信单一来源的跑分:官方「超越闭源」的结论基于自有基准,独立复现出来之前保持保留。
- 显存要有余量:透明通道与 10 图参考对显存更敏感,24GB 以下建议开 CPU offload 或降分辨率。
- 回调原文:多参考图合并时主体归属偶有偏差,商用素材务必人工过一遍。
FAQ
Q:Qwen-Image-2.1 能商用吗? A:不能直接商用。权重采用 Qwen 研究许可,仅限研究与非商业用途。商业部署需向 Qwen 申请单独授权,官方未公布授权价格。
Q:和上一代 Qwen-Image 2.0 有什么区别? A:2.0 发布于 2026 年 2 月。2.1 把透明图能力(原属独立的 Qwen-Image-Layered)并进主模型,把参考图上限提到 10 张,并统一了生成与编辑两条路径。
Q:需要什么显卡? A:官方称可在 RTX 3090 及以上消费级显卡运行。SGLang 实测 RTX 4090 24GB 配合 CPU offload 生成 1024×1024 约 18.7 秒;显存更小时建议降分辨率或加强 offload。
Q:有没有 hosted API 版本? A:有。此前数周 Qwen 已上线闭源的 Qwen-Image 3.0 托管服务;这次的 2.1 是权重可下载的对应版本,能力侧重不同。
延伸阅读
- 相关模型:TranslateGemma / Qwen3-Coder / Kimi K3
- 概念:多模态大模型 / LoRA 微调
- 资讯:Qwen-Image-2.1 开源权重发布
来源
- The Decoder — 《Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation with just 7 billion parameters》(2026-09-20):https://the-decoder.com/alibabas-open-weight-qwen-image-2-1-claims-to-beat-closed-models-in-image-generation-with-just-7-billion-parameters/
- METAL — 《Alibaba's Qwen Releases Qwen-Image-2.1》(2026-09-20,含架构与许可细节):https://metallab.ai/en/2026/9/qwen-image-2-1-release
- HuggingNews — 《Alibaba Ships Open Weight 7B Qwen-Image-2.1 With Native RGBA Transparency》(2026-09-20,含 SGLang 性能数据):https://huggingnews.com/ai/alibaba-ships-open-weight-7b-qwen-image-21-with-native-rgba-transparency-34978f22
- AI Intel Report — 《Qwen-Image-2.1 Open Weights Released for Unified Image Generation and Editing》:https://aiintelreport.com/frontier-models/qwen-image-2-1-open-weights-release
- Hugging Face 模型仓库:https://huggingface.co/Qwen/Qwen-Image-2.1
核对日期:2026-09-21。商用授权价格、官方完整吞吐数据表两项待核实。
Alice vs Flowith:桌面快捷键助手 vs 画布工作空间(2026 实测选型)
Alice vs Flowith 2026 选型对比:heyalice.app 全局快捷键桌面助手(BYO API + 一次买断) vs 新加坡无限画布 AI 工作空间(Agent Neo 10M 上下文 + Knowledge Garden)。从定位、核心能力、模型支持、价格、国内可用性 6 个维度帮你选对 AI Agent。
Claude Desktop vs Flowith:AI Agent 怎么选?2026 对比
Claude Desktop vs Flowith 2026 选型对比:Anthropic 官方桌面客户端(原生 MCP + .mcpb 扩展) vs 新加坡画布式 AI 工作空间(Agent Neo 10M 上下文 + Knowledge Garden)。从定位、核心能力、模型支持、价格、国内可用性、适用场景 6 个维度帮你选对 AI Agent。
Cursor vs v0:AI 编程 IDE vs AI 前端生成器怎么选?
Cursor vs v0 2026 选型对比:Anysphere 的 AI 原生 IDE vs Vercel 的 AI 前端组件生成器。从定位、工作流、输出物、价格、适合人群 6 个维度帮你选对工具:全栈工程选 Cursor,快速 UI 原型选 v0。
Flowith vs Genspark:AI Agent 怎么选?2026 对比
Flowith vs Genspark 2026 选型对比:无限画布 + 10M token 上下文的 Flowith vs 多 Agent 架构 + Sparkpage 全栈输出的 Genspark。从定位、核心能力、模型支持、价格、国内可用性和适用场景 6 个维度帮你选对 AI Agent。
Lovable vs v0:AI 应用生成器 vs 前端组件生成器怎么选?
Lovable vs v0 2026 选型对比:全栈应用生成器(Supabase 后端一体化)vs Vercel 前端组件生成器(React+shadcn/ui)。从生成范围、后端能力、部署、价格和适合人群帮你选对 AI 生成工具。
v0 vs Bolt.new:AI 前端生成工具怎么选(2026)
v0 与 Bolt.new 都能用自然语言生成前端应用。一句话结论 + 决策树 + 价格对比:要组件级产出与设计系统一致性选 v0,要全栈跑通与浏览器内开发选 Bolt.new。