Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像
Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation
精选理由
官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。
AI 摘要
Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。
正文 · AI 翻译
GITHUB HUGGING FACE MODELSCOPE
我们很高兴开源 Qwen-Image-2.1,这是 Qwen 家族中的一款图像模型,在生成质量、推理效率与成本之间取得平衡。Qwen-Image-2.1 将文生图生成与图像编辑统一在单一模型中,其视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。
本次更新带来四项关键改进:
紧凑高效:轻量级架构与推理优化在图像质量与计算成本之间取得平衡。
原生透明,统一创作与编辑:根据提示词生成普通或透明图像,编辑透明图层,并从照片中提取主体。
多样化编辑:最多可使用 10 张参考图像,指定局部编辑,保留人物与产品,并处理各类任务。
逼真质感与精致美学:改进的排版、人像光影与精细细节让生成图像更具视觉吸引力。
紧凑高效#
Qwen-Image-2.1 采用轻量级架构。其视觉生成组件包含 32 层单流 DiT 和 7B 参数。尽管体量紧凑,该模型仍能提供出色的图像生成质量。下方的 Qwen-Image-Bench 对比展示了它与其他开源和闭源模型的表现对比。
Qwen-Image-Bench 评测对比
推理效率是另一个重点,尤其是在使用多张输入图像进行编辑时。这一优化来自 混合粒度注意力架构。文本(包括系统前缀和编辑指令)使用 token 级因果掩码,而图像生成使用块级掩码。KV cache 复用 使输入图像和编辑指令可作为静态上下文,在第一步中计算并缓存,从而提升推理效率并降低内存占用。
Qwen-Image-2.1 混合粒度注意力架构
原生透明度,统一创作与编辑#
原生透明度是本次发布的一大新增功能。2025 年 12 月,我们推出了 Qwen-Image-Layered,作为一款支持透明图像生成的专用模型。Qwen-Image-2.1 现将这一能力整合进统一模型,通过提示词决定是输出普通图像还是带透明度通道的图像。
以下是由文本直接生成的透明图像示例:
除了单个主体之外,该模型还能生成由多个元素构成的更复杂的透明图像,为设计和素材创作开辟了更多可能性。
通过统一生成与编辑,Qwen-Image-2.1 还支持直接编辑透明图像。例如,它可以在保留透明背景的同时改变主体的表情。左侧为输入,右侧为编辑结果。
透明图层中的文字同样可以编辑。在下面的示例中,“BLOOM”被替换为“Qwen-Image”。
这一能力也延伸到了真实照片。给定一张 RGB 图像,该模型可以将所需主体提取为带透明度的 RGBA 图层,从而更便于在后续的设计与合成工作中复用元素。
多样化编辑#
Qwen-Image-2.1 在四个方面改进了编辑能力:多参考图像、局部编辑、保真度保持以及任务覆盖范围。
多参考:最多 10 张输入图像#
Qwen-Image-2.1 支持最多 10 张参考图像,可将多个主体和素材组合成一幅协调的构图。在下面的合影示例中,左侧的六张单人肖像被汇聚到一张照片中。
一张由六张人像参考图生成的全家福照片
在虚拟试穿场景中,五个输入——模特、服装、鞋子、包和帽子——可以组合成一套完整的穿搭。
一套由五张参考图生成的完整穿搭
在室内设计场景中,模型可以使用 10 张家具图片生成一个完整的房间布置。
一个由十张家具参考图生成的室内场景
局部编辑:灵活的区域选择#
Qwen-Image-2.1 支持用圆圈、手绘标注和独立掩码来指定编辑应当发生的位置。
第一个示例使用不同颜色的圆圈一次性标出三个区域:“移除蓝色圆圈中的金属手表,将红色圆圈中的头发改为黑色,并将绿色圆圈中的区域替换为灰色短袖亚麻睡衣。”标注后的输入在左侧,结果在右侧。
手绘标注提供了另一种标出区域的方式。在这个示例中,模型在输入图像右侧用白色标出的区域中添加了一名潜水员。
圆圈和手绘标注会遮挡部分原始内容。为保留完整输入,Qwen-Image-2.1 还支持将原始图像和单独的掩码作为两个输入。以下示例要求模型使用这两张图像生成一个骑马牛仔:
模型对掩码指定的区域进行编辑,生成以下结果:
掩码引导编辑结果:一个骑马牛仔
局部编辑还可以支持连续创作。通过在保留场景其余部分的同时进行连续修改,编辑后的图像可以组合成简单的动画,如下方的水豚葫芦兄弟示例所示。
视频 · 前往原文观看
保真度:保留人物与产品#
保真度的改进主要集中在人像身份和产品一致性上。对于人像,模型能更好地保留面部特征,使人物身份在多次编辑中保持更高的一致性。下方每一组左侧为输入,右侧为编辑结果。
对于产品编辑,模型旨在保留文字、纹理和形状,使产品的标志性特征在新图像中保持一致。
任务覆盖范围:全景图、信息图与故事板#
Qwen-Image-2.1 支持广泛的编辑任务,包括全景图、信息图和分镜图生成,在不同应用之间实现了能力平衡。
例如,从这张自拍开始:
用于全景图生成的输入自拍
模型生成了以下全景图:
由自拍生成的全景图
随后可以在可视化工具中从不同视角方向探索这张全景图。
视频 · 前往原文观看
在信息图生成方面,一张模特照片可以被扩展为细节丰富、信息密集的构图。
用于信息图生成的输入模特照片
由模特照片生成的复杂信息图
该模型还可以将三视图角色参考图转化为完整的分镜图,为故事叙述和视觉叙事提供素材。
用于分镜图生成的三视图角色参考图
由角色参考图生成的完整分镜图
逼真的纹理与精致的美学#
Qwen-Image-2.1 进一步提升了视觉质量,尤其关注排版和肖像。文本渲染不仅考虑内容本身,还考虑字体样式、布局及其与整体构图的关系。以下示例展示了不同场景下的文本渲染效果。
文本渲染示例一
文本渲染示例二
文本渲染示例三
文本渲染示例四
对于肖像,改进的光照和精细细节让生成的图像呈现出更逼真的外观。
肖像光照与细节示例一
肖像光照与细节示例二
结论#
凭借紧凑的 7B 视觉生成组件,Qwen-Image-2.1 将图像生成、透明度和广泛的编辑能力集于一个模型之中。更快的推理速度、最多支持 10 张参考图像、灵活的局部编辑,以及对人物和产品更高的保真度,使其成为设计、内容创作、电商和视觉叙事的实用工具。
希望您喜欢用 Qwen-Image-2.1 进行创作!
原文
Original Title
Qwen-Image-2.1: Compact, Efficient, and Unified Image Creation
Source
Qwen:Blog Retrieval(API)
Site
qwen.ai
Author
QwenTeam
Published
2026-09-20 20:00