就在几天前阿里千问放出了 Qwen-Image-2.1 的权重。文生图、图像编辑和透明图层这次被集成到同一个 7B 主干。许可证也从 Apache 2.0 换成研究许可商用仍需单独授权。权重同步上到 Hugging Face、ModelScope 与 GitHub主流框架发布当天就能接入。一、这次开源了什么7B 指的是视觉主干具体是 32 层 Single-Stream DiT。文本与条件编码器是 Qwen3-VL 8B自编码器为 64 通道、16 倍空间压缩整包 BF16 合计约 33 GB。编码器比扩散主干还大算显存时不能只盯着这个数。原生 RGBA 是这次的主项。透明度在采样阶段同步生成省掉了先生成不透明图再跑抠图的两段式流程。按提示词直接出透明素材、在透明图层上继续编辑、从普通照片里抽出带 alpha 的主体三个动作都支持。这项能力此前由单独的 Qwen-Image-Layered 承担现在并回了主模型。生成和编辑合并进一个 checkpoint。传参考图是编辑不传就是文生图走同一套管线。参考图上限提到 10 张官方给的例子里六张单人肖像能合成一张合影。局部编辑支持画圈、涂抹和单独传 mask 三种指路方式。效率靠混合粒度注意力条件部分只算一次后面每步复用缓存。默认输出 2048×2048、40 步。二、和上一代比和同行比纵向看主干反而缩了从 20B 到 7B编码器反向升到 8B。榜单分数一路从 49.23 走到 60.28。版本主干关键变化许可证总分第一代20B中英文字渲染打出声量Apache 2.049.23251220B人像真实感盲测开源第一Apache 2.052.062.0更轻原生 2K生成编辑统一闭源为主57.842.17B统一模型加 RGBA 与多图参考研究许可60.28许可证是唯一的退步项。前几代都可自由商用2.1 与两个配套的提示词改写模型改成研究许可社区量化版与微调版继承同一限制。还有一点容易混图像线今年夏天发过 3.0走百炼 API 和闭源商用路线至今没有权重它和开源的 2.1 并行不存在前后代关系。横向看2.1 是开源第一但榜首仍由闭源占据。模型总分类型GPT Image 2.5 Sunburst67.01闭源GPT Image 264.69闭源Grok Imagine 2.063.47闭源Qwen Image 3 Pro62.36闭源Qwen-Image-2.160.28开源Nano Banana 2.059.82闭源FLUX 2 Max55.33开源 32BQwen-Image-251252.06开源 20B它比 32B 的 FLUX 2 Max 高出近 5 分靠的是 7B 主干。超过 Nano Banana 2.0 只有 0.46 分算是同一水平线上的微幅领先。前面还站着六个闭源模型榜首高出 6.73 分。基准由千问自建裁决模型也出自自家团队目前还没有第三方复现1 分以内的差距接近噪声。两者的能力也不重叠Nano Banana 2.0 有 4K 和更极端的画幅但没有透明通道2.1 有原生透明分辨率却止于 2048×2048。三、跑起来需要什么配置显存是第一道门槛官方仓库没有公布下限。以下数字来自各推理框架的部署说明与第三方实测。配置占用适配BF16 全量约 33 GB32 GB 卡放不下BF16 全驻留1024²40 步峰值约 34 GB需要数据中心卡FP8 编码器加 BF16 主干27.5 至 28.1 GB折中方案INT8 量化版16.1 GiB可整跑 4090开启 CPU 卸载可低至 3 GB 级代价是速度把文本编码器卸到内存是更实际的做法。它每个提示词只跑一次放在系统内存里按层送入显卡14.2 GB 的主干与自编码器保持驻留24 GB 的消费级卡就能稳定工作。速度方面同一张卡在不同框架下差距很大。5090 配 FP8 主干、40 步、1024×1024文生图约 5.9 秒编辑约 7.1 秒4090 开启卸载后是 18.7 秒与 21.7 秒。社区在 4090 上按分辨率的实测更有参考价值2048×2048 约 30 秒3072×3072 约 95 秒推到 4096×4096要三分钟以上画面还开始出现纹理异常。这基本就是它的质量上限。接入路径已经铺好Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 都在发布当天提供支持环境依赖 PyTorch 2.4 以上、transformers 5.17 以上。四、能落地的场景电商与商品素材是最直接的一类。透明底主图过去要走出图、抠图、修边、导出四步现在在提示词里写明透明背景交付的就是可直接合成的素材。设计物料的批量生产同样受益贴纸、图标、标志、游戏资产这类需要分层复用的素材原生 alpha 省掉了抠图插件这一环。多素材合成的价值更高把商品、模特、配饰几张图作为参考输入让模型拼成完整场景。内容侧还覆盖全景图、信息图与分镜图拿三视图做角色参考能直接出多格分镜。五、千问在开源上的位置这条线的节奏清楚。从第一代到这一代迭代基本维持在半年以内方向一直没偏早期主攻文字渲染中期提升人像真实感这一代转向工作流整合。模型形态从多套权重收成一个 checkpoint部署复杂度与显存切换成本同步下降。生态响应是另一个信号。发布当天上面提到的五个框架都给出了支持路径社区首日就产出了量化版、微调版和在线体验空间AMD 的 ROCm 与 FlagOS 也已适配覆盖八个异构芯片平台。权重进入主流框架的速度比模型卡上的形容词更能说明它是否真的可用。许可策略则出现分化语言模型线大多维持 Apache 2.0图像线从 2.1 开始收紧商用条款。常见问题可以商用吗权重与研究用途免费商用需要向千问单独申请授权社区量化版与微调版继承同一许可协议。需要多少显存BF16 全量约 33 GBINT8 量化版可压到 16.1 GiB4090 一档能够整跑把编码器卸载到内存后24 GB 显卡也能满足。怎么输出透明图提示词里显式写明这是 RGBA 图像、需要透明背景模型才会走透明通道。它和 Qwen-Image-3.0 是什么关系3.0 是今年夏天发布的闭源商用版本通过百炼平台提供 API目前没有权重2.1 是开源线接在 2.0 之后的新版本。结论Qwen-Image-2.1 把文生图、图像编辑与透明输出集成到一个 7B 主干的模型开源阵营里目前没有直接对手强在工程整合和单位成本。短板是 2048×2048 的分辨率上限以及需要单独谈判的商用许可。研究和原型验证可以直接上手。要走商用链路上线前先把授权范围和显存预算算清楚。