OmniTools 9月20日消息,通义千问团队正式开源 Qwen-Image-2.1 模型。该模型将文生图与图像编辑能力整合于单一架构中,视觉生成组件参数量仅 7B,并原生支持透明图像(Alpha 通道)的生成与编辑。
Qwen-Image-2.1 支持最多 10 张参考图输入,提供圆形、涂鸦及独立蒙版等多种局部编辑方式;采用混合粒度注意力机制与 KV cache 复用技术以提升推理效率。模型在文字渲染、人像光照一致性、人物与产品细节保真度方面均有改进。
此外,该模型适配全景图生成、信息图表绘制及分镜设计等多样化视觉任务。项目代码与模型权重已公开发布。