首个办公文档理解基准OCB发布,GPT-4o仅得59.3分

arXiv·18 天前

近日,研究人员在arXiv上发布了首个面向办公文档理解的综合性基准——Office Comprehension Bench(OCB)。该基准首次实现对大型语言模型在Word、Excel、PowerPoint原生格式(.docx、.xlsx、.pptx)及其变体上的联合评估。

OCB包含两大测试轨道:文件保真度问答测试模型对办公文档结构元素的感知能力,包括表格、图表、嵌入图像、公式以及页眉、演讲者备注等应用特定元素;领域问答则基于12个专业领域的真实行业文档,要求模型进行多步骤分析和跨文档综合推理。

评估采用创新的原子化评分机制,将参考答案分解为可二元评分的独立主张,并由多个LLM评委独立打分。结果显示,即使在默认推理模式下表现最强的前沿系统,在领域问答中也仅达到约59.3%的准确率。研究还发现,在同一产品层级内增加思考深度对性能提升有限,而升级到更高产品层级仅带来适度改善。

研究团队同时公开了完整数据集、评估工具、评委提示词和公共排行榜,为办公文档理解领域的研究提供了标准化评估框架。该基准的发布有望推动AI在处理复杂办公文档方面的能力发展。

基准测试办公文档多模态理解评估方法LLM评测

原文来源:https://arxiv.org/abs/2607.01245

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回