通义千问推出Qwen-Image-Edit:图像编辑新方案,支持精准文本修改
通义千问团队近日推出图像编辑模型Qwen-Image-Edit。该模型基于200亿参数的Qwen-Image构建,成功将其独特的文本渲染能力迁移至图像编辑任务中,能够对图像中的文字内容进行精准修改。技术架构上,模型创新性地同时将输入图像分别送入Qwen2.5-VL模型(负责视觉语义理解)和VAE编码器(负责视觉外观特征提取),实现了语义编辑与外观编辑的协同控制。这一设计使模型不仅能理解编辑指令的语义意图,还能保持图像原有的视觉风格与细节一致性,在提升编辑质量的同时优化了处理效率。该模型的发布标志着多模态图像编辑技术向更精细、可控的方向迈出重要一步。