阿里千问开源Qwen-Image-2.1:7B参数图像模型实现透明图层生成编辑
摘要
阿里千问开源Qwen-Image-2.1图像模型,将文生图与图像编辑整合于单一模型,视觉生成部分仅7B参数,原生支持透明图像生成与编辑,最多可处理10张参考图,已在GitHub、HuggingFace和ModelScope上线。
9月20日,阿里千问宣布开源新一代图像模型Qwen-Image-2.1。该模型将文本生成图像与图像编辑能力整合在同一架构中,视觉生成部分参数量仅为7B,官方称其在生成效果、推理效率与使用成本之间实现了平衡。模型权重及相关资源已在GitHub、HuggingFace和ModelScope三个平台同步发布。
此次更新围绕四个方向展开。在模型效率方面,Qwen-Image-2.1采用轻量化结构与推理优化,试图在生成质量与计算开销之间找到更优解。在透明图像处理上,模型原生支持根据提示词生成普通图像或透明图像,并可直接对透明图层进行编辑与抠图操作,这一能力在开源图像模型中较为少见。
编辑能力方面,Qwen-Image-2.1支持最多10张参考图输入,增强了局部编辑、人像与商品保真度,覆盖多种编辑任务场景。官方展示的示例中,模型可基于十张家居参考图生成室内布置方案。此外,模型在文字排版、人物光影与细节表现上也有所提升,旨在让生成结果更具美感。
从行业视角看,Qwen-Image-2.1将生成与编辑统一、原生透明图层支持以及多参考图输入打包进一个7B参数模型,对需要低成本部署图像生成能力的中小团队具有一定吸引力。目前该模型已开放下载,开发者可基于其进行二次开发或集成。
本文由新大陆基于公开信息编辑整理
信息来源:IT之家 IT之家原文 ↗