AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多模态模型
15 篇相关内容
相关话题
通义千问
计算机视觉
开源模型
视觉语言模型
AI4S
科学计算
蛋白质预测
分子生成
端侧AI
物理世界AI
Om AI联汇
流式处理
S1-Omni:首个统一多模态科学推理模型问世,多项任务超越GPT-5.5
研究人员推出S1-Omni模型,首次将科学理解、预测与生成能力整合于统一框架,在60多个科学基准测试中表现优异,多数任务超越GPT-5.5和Gemini-3.1-Pro。
a
arXiv
·
21 小时前
AI4S
多模态模型
科学计算
蛋白质预测
a
Om AI联汇发布VLX:全球首个面向物理世界的端侧流式多模态模型
Om AI联汇推出全球首个面向物理世界的端侧流式多模态模型VLX,标志着AI在物理交互领域迈出重要一步。
O
Om AI联汇
·
19 天前
多模态模型
端侧AI
物理世界AI
Om AI联汇
O
智谱发布GLM-5V-Turbo视觉编程模型,原生支持多模态输入
智谱AI正式推出GLM-5V-Turbo视觉编程模型,该模型原生支持图像、视频、设计稿和文档布局等多模态输入,在视觉与编程能力间取得平衡。
智
智谱 GLM
·
20 天前
智谱GLM
多模态模型
视觉编程
AI编程
智
EVLA:首个融合车辆电驱状态感知的多模态驾驶助手
研究人员提出新型多模态驾驶助手EVLA,首次将实时电驱系统状态(如电机扭矩、电池电量)融入视觉-语言模型,实现基于物理约束的驾驶决策。
a
arXiv
·
20 天前
自动驾驶
多模态模型
物理建模
AI驾驶助手
a
COMPASS框架:统一多模态模型实现构图意图感知与生成控制
研究者提出COMPASS框架,首次在统一多模态系统中实现构图意图的感知与可控生成,通过共享专家令牌连接分析与生成任务。
a
arXiv
·
20 天前
多模态模型
可控生成
构图理解
人工智能框架
a
Gemini 1.5 Flash 模型新增计算机使用能力,推理与工具调用效率再升级
Google DeepMind 宣布为 Gemini 1.5 Flash 模型引入计算机使用能力,使其能够理解屏幕内容并执行操作指令,显著提升多步骤任务的自动化效率。
G
Google DeepMind
·
26 天前
Gemini
Google DeepMind
AI 代理
多模态模型
G
医疗AI评估新突破:MedBench v5引入动态过程导向与幻觉监测
研究者推出MedBench v5临床多模态模型基准测试,从静态问答转向动态过程评估,首次整合幻觉传播监测与可控压力测试,揭示模型任务表现与过程稳定性之间的关键差异。
a
arXiv
·
26 天前
医疗AI
基准测试
多模态模型
幻觉检测
a
Gopuff与SpaceXAI联手推出AI购物助手Go,Grok多模态模型驱动
Gopuff与SpaceXAI合作推出个人购物助手Go,宣称能理解用户需求并在几分钟内完成配送,背后由Grok文本、音频和图像多模态模型提供支持。
x
xAI
·
27 天前
快讯
Grok
xAI
AI购物助手
多模态模型
x
Together AI 首发上线 NVIDIA Nemotron 3 Nano Omni:全能多模态推理模型
Together AI 在发布首日即上线 NVIDIA Nemotron 3 Nano Omni 模型,这是一个面向大规模智能体工作负载设计的统一开源模型,可跨视频、图像、音频和文本进行推理。
T
Together AI
·
27 天前
多模态模型
NVIDIA
Together AI
开源模型
T
通义千问发布Qwen2.5-VL多模态模型,视觉理解能力大幅提升
阿里云通义千问团队正式推出新一代视觉语言模型Qwen2.5-VL,在视觉理解能力上实现显著突破,提供3B、7B、72B三种规格的开源版本。
通
通义千问 Qwen
·
28 天前
通义千问
多模态模型
视觉语言模型
开源模型
通
通义千问发布Qwen2.5-VL-32B:更智能、更轻量的视觉语言模型
阿里云通义千问团队在Qwen2.5-VL系列基础上,通过强化学习优化并开源了32B参数的视觉语言模型Qwen2.5-VL-32B-Instruct。
通
通义千问 Qwen
·
28 天前
通义千问
多模态模型
视觉语言模型
开源AI
通
通义千问发布Qwen2.5 Omni:多模态旗舰模型,支持看听说写全能交互
通义千问推出新一代旗舰多模态模型Qwen2.5-Omni,实现文本、图像、音频、视频的端到端处理,并支持实时流式响应与语音合成。
通
通义千问 Qwen
·
28 天前
通义千问
多模态模型
AI开源
语音合成
通
通义千问发布Qwen-Image图像模型,原生文本渲染能力显著提升
通义千问团队发布20B参数规模的Qwen-Image图像基础模型,在复杂文本渲染与精细图像编辑方面实现突破。
通
通义千问 Qwen
·
28 天前
通义千问
图像生成
多模态模型
文本渲染
通
通义千问推出Qwen-Image-Edit:图像编辑新方案,支持精准文本修改
基于200亿参数Qwen-Image模型开发的Qwen-Image-Edit正式发布,该模型将文本渲染能力扩展至图像编辑领域,实现语义与外观的双重控制。
通
通义千问 Qwen
·
28 天前
通义千问
多模态模型
图像编辑
Qwen
通
Mistral AI 推出新一代 OCR 识别模型 Mistral OCR 3
Mistral AI 正式发布 Mistral OCR 3,该模型在文档图像的文字识别准确率与多语言支持方面均有显著提升。
M
Mistral AI
·
28 天前
Mistral AI
OCR
多模态模型
文档理解
M