通义千问发布视觉推理模型QVQ-Max,实现图像视频内容分析与推理

继去年12月推出探索性模型QVQ-72B-Preview后,通义千问团队今日正式发布首个版本的视觉推理模型QVQ-Max。该模型突破了传统视觉模型的局限,不仅能准确识别图像与视频中的内容,更具备深层次的信息分析与逻辑推理能力。在实际测试中,QVQ-Max在解决数学问题、回答日常疑问、编写程序代码乃至辅助艺术创作等方面均表现出色。相比此前发布的预览版本,新模型在推理准确性和应用稳定性方面均有显著提升,标志着通义千问在视觉理解与推理技术领域迈出重要一步。目前该模型已在GitHub、Hugging Face、ModelScope等平台开放访问,并设有Discord社区供开发者交流。

通义千问视觉推理模型多模态AI阿里云人工智能

原文来源:https://qwenlm.github.io/blog/qvq-max-preview/

相关阅读

通义千问Qwen2.5正式发布,开源阵容再创新高
通义千问开源Qwen2.5-Coder系列:32B版本媲美GPT-4o,覆盖多尺寸与编程语言
通义千问Qwen2.5-Turbo发布:上下文长度突破100万tokens
通义千问发布QwQ模型:以哲学思辨探索认知边界
通义千问发布视觉增强大模型QVQ,探索语言与视觉融合新路径

← 返回