通义千问发布Qwen2.5 Omni:多模态旗舰模型,支持看听说写全能交互

通义千问团队正式发布Qwen2.5-Omni,这是该系列最新的旗舰级端到端多模态模型。该模型专为全面多模态感知设计,能够无缝处理文本、图像、音频和视频等多种输入形式,同时通过文本生成和自然语音合成提供实时流式响应。用户现可通过Qwen Chat平台体验Qwen2.5-Omni-7B版本。模型已在Hugging Face、ModelScope、DashScope及GitHub等平台开源,技术细节详见同期发布的论文。此次更新标志着通义千问在多模态AI领域的技术突破,为开发者提供了更强大的跨模态交互工具。

通义千问多模态模型AI开源语音合成端到端学习

原文来源:https://qwenlm.github.io/blog/qwen2.5-omni/

相关阅读

通义千问Qwen2.5正式发布,开源阵容再创新高
通义千问开源Qwen2.5-Coder系列:32B版本媲美GPT-4o,覆盖多尺寸与编程语言
通义千问Qwen2.5-Turbo发布:上下文长度突破100万tokens
通义千问发布QwQ模型:以哲学思辨探索认知边界
通义千问发布视觉增强大模型QVQ,探索语言与视觉融合新路径

← 返回