通义千问推 Qwen-Image-2.1:7B 单检查点打通图像生成与编辑
摘要
通义千问发布 Qwen-Image-2.1,一个 7B 参数的原生图像生成与编辑模型,生成与编辑共用单一检查点,最多支持 10 张参考图,并自带提示词增强 LLM。模型已集成 diffusers 与 ComfyUI,同时在 Hugging Face Spaces 上线免安装浏览器 demo。
通义千问团队近日推出 Qwen-Image-2.1,将图像生成与图像编辑两项任务收拢到同一个模型之中。与此前常见的多检查点方案不同,该模型以 7B 参数规模实现原生统一,生成与编辑不再需要分别加载不同权重。
在能力细节上,Qwen-Image-2.1 的单一检查点同时承担生成和编辑职能,并支持最多 10 张参考图输入。模型内部还集成了一个提示词增强 LLM,用于在推理阶段对用户输入进行优化,降低提示词工程门槛。
工程落地方面,Qwen-Image-2.1 已完成与 diffusers 和 ComfyUI 的集成,开发者可以直接在既有工作流中调用。此外,官方在 Hugging Face Spaces 提供了免安装的浏览器在线 demo,用户无需本地部署即可体验模型效果。
从行业视角看,将生成与编辑合并到单一 7B 检查点,意味着推理部署时只需维护一套权重,有望降低显存占用与切换成本。参考图上限提升至 10 张,也为多图条件控制类应用留出更大空间。
本文由新大陆基于公开信息编辑整理
信息来源:AIHOT AIHOT原文 ↗