通义千问推出Qwen-Image-Edit:图像编辑新方案,支持精准文本修改

通义千问团队近日推出图像编辑模型Qwen-Image-Edit。该模型基于200亿参数的Qwen-Image构建,成功将其独特的文本渲染能力迁移至图像编辑任务中,能够对图像中的文字内容进行精准修改。技术架构上,模型创新性地同时将输入图像分别送入Qwen2.5-VL模型(负责视觉语义理解)和VAE编码器(负责视觉外观特征提取),实现了语义编辑与外观编辑的协同控制。这一设计使模型不仅能理解编辑指令的语义意图,还能保持图像原有的视觉风格与细节一致性,在提升编辑质量的同时优化了处理效率。该模型的发布标志着多模态图像编辑技术向更精细、可控的方向迈出重要一步。

通义千问多模态模型图像编辑QwenAIGC

原文来源:https://qwenlm.github.io/blog/qwen-image-edit/

相关阅读

通义千问Qwen2.5正式发布,开源阵容再创新高
通义千问开源Qwen2.5-Coder系列:32B版本媲美GPT-4o,覆盖多尺寸与编程语言
通义千问Qwen2.5-Turbo发布:上下文长度突破100万tokens
通义千问发布QwQ模型:以哲学思辨探索认知边界
通义千问发布视觉增强大模型QVQ,探索语言与视觉融合新路径

← 返回