AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
多模态理解
2 篇相关内容
相关话题
基准测试
办公文档
评估方法
LLM评测
视觉语言模型
结构歧义
评测基准
自然语言处理
首个办公文档理解基准OCB发布,GPT-4o仅得59.3分
研究者推出首个面向Word、Excel、PowerPoint原生格式的综合性基准OCB,测试显示当前最强模型在专业领域问答中仅获59.3%准确率。
a
arXiv
·
18 天前
基准测试
办公文档
多模态理解
评估方法
a
LaViSA:首个视觉语言模型结构歧义评测基准发布
研究团队推出LaViSA基准,专门评估视觉语言模型利用视觉场景解决句子结构歧义的能力,实验发现现有模型在部分歧义类型和视觉语义细微差异上仍存在局限。
a
arXiv
·
31 天前
视觉语言模型
结构歧义
评测基准
多模态理解
a