WILDTRACE:首个自然证据链长文档推理基准,挑战AI深层理解能力
在现实世界的长文档分析中,回答复杂问题往往需要整合分散在不同段落中的证据。例如,事故报告中解释灾难的操作条件、设计缺陷和遗漏的安全检查可能相隔数十个章节;小说中角色的真实动机可能只在远离相关场景的地方浮现。这种源内证据整合是长文档分析的核心,但现有基准大多回避了这一挑战。
传统评估方法如“针探测试”、植入事实和反向工程的多跳推理链,其证据可能在分布、位置或语言风格上与原文存在差异,导致模型表现优异可能反映的是分布伪影而非真正的源推理能力。为此,研究团队推出了WILDTRACE基准数据集,包含481个任务和214个自然形成的长文档源,如技术事故报告和鲜为人知的文学叙事。所有证据链均源自文档自身的因果、时间和叙事逻辑。
基于Pearl因果层次理论和先前多跳推理类型学,研究团队定义了七种源内证据几何结构,刻画了长文档分析阅读中不同的关系需求。该基准采用源优先构建流程:首先从文档结构中挖掘候选证据链,再编写问题;每个项目经过多阶段验证,涵盖线索必要性、答案基础性、评分标准保真度、抗污染性和可回答性。
随着AI模型越来越多地承担现实世界高风险分析任务,访问信息与对自然分散证据进行推理之间的差距,已成为长上下文研究下一阶段的关键挑战。WILDTRACE的推出为评估模型在真实场景下的深层理解能力提供了重要工具。