AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
LLM评测
1 篇相关内容
相关话题
基准测试
办公文档
多模态理解
评估方法
首个办公文档理解基准OCB发布,GPT-4o仅得59.3分
研究者推出首个面向Word、Excel、PowerPoint原生格式的综合性基准OCB,测试显示当前最强模型在专业领域问答中仅获59.3%准确率。
a
arXiv
·
18 天前
基准测试
办公文档
多模态理解
评估方法
a