首个办公文档理解基准OCB发布,GPT-4o仅得59.3分
近日,研究人员在arXiv上发布了首个面向办公文档理解的综合性基准——Office Comprehension Bench(OCB)。该基准首次实现对大型语言模型在Word、Excel、PowerPoint原生格式(.docx、.xlsx、.pptx)及其变体上的联合评估。
OCB包含两大测试轨道:文件保真度问答测试模型对办公文档结构元素的感知能力,包括表格、图表、嵌入图像、公式以及页眉、演讲者备注等应用特定元素;领域问答则基于12个专业领域的真实行业文档,要求模型进行多步骤分析和跨文档综合推理。
评估采用创新的原子化评分机制,将参考答案分解为可二元评分的独立主张,并由多个LLM评委独立打分。结果显示,即使在默认推理模式下表现最强的前沿系统,在领域问答中也仅达到约59.3%的准确率。研究还发现,在同一产品层级内增加思考深度对性能提升有限,而升级到更高产品层级仅带来适度改善。
研究团队同时公开了完整数据集、评估工具、评委提示词和公共排行榜,为办公文档理解领域的研究提供了标准化评估框架。该基准的发布有望推动AI在处理复杂办公文档方面的能力发展。