AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
指令理解
1 篇相关内容
相关话题
多模态大模型
视觉推理
语义鸿沟
arXiv研究
视觉任务语义挑战:多模态大模型在图文混合指令下表现显著下滑
研究发现,当任务指令以图像形式呈现时,多模态大语言模型的推理准确率平均下降17.8个百分点,揭示模型存在“语义通道鸿沟”。研究者提出“提示区域定位”方法,有效提升模型对视觉化指令的理解能力。
a
arXiv
·
28 天前
多模态大模型
视觉推理
指令理解
语义鸿沟
a