Qwen 开源 7B 统一图像模型 Qwen-Image-2.1,原生支持透明图像生成与编辑
摘要
Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一于一个模型,视觉生成组件仅 7B 参数,并原生支持透明图像。模型可接受最多 10 张参考图,支持圆形、涂鸦及独立蒙版局部编辑,通过混合粒度注意力与 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与保真度。
Qwen 团队近日开源了新一代图像模型 Qwen-Image-2.1,其核心思路是将文生图与图像编辑两项任务整合进同一个模型,而不再依赖独立管线。该模型的视觉生成组件参数量为 7B,在保持轻量化的同时覆盖生成与编辑两类场景。
在功能层面,Qwen-Image-2.1 原生支持透明图像的生成和编辑,这一能力在开源图像模型中并不常见。模型最多可接收 10 张参考图作为条件输入,并允许用户通过圆形、涂鸦或独立蒙版等方式指定局部编辑区域,提升了交互控制的灵活性。
推理效率方面,该模型采用混合粒度注意力架构,并引入 KV cache 复用机制,以降低计算开销、加快响应速度。此外,团队针对文字渲染、人像光照以及人物与产品保真度进行了改进,使模型在全景图、信息图和分镜等任务上具备更好的适用性。
从行业视角看,Qwen-Image-2.1 将生成与编辑统一、支持透明图像并开放权重,为开发者在内容创作、电商素材与设计辅助等方向提供了新的基础模型选项,其 7B 的体量也降低了部署门槛。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗