LakeQuest基准:三大领域数据湖问答系统面临真实挑战

arXiv·6 天前

当前问答系统虽然在结构规整的数据集上表现出色,但现实世界中的企业数据湖和科学数据往往呈现异构、弱结构化的特征。现有基准测试大多忽略了这种复杂的发现过程,无法评估端到端的系统性能。为此,研究团队提出了LakeQuest基准,这是一个包含9,846个人工验证问答对的评测集,专门用于评估在真实数据湖环境下的检索与合成流程。

LakeQuest覆盖三个多样化领域:AI/ML元数据、零售银行交易记录以及多模态生物医学药物信息。每个问题都配有精确的、考虑模态的证据指针。通过将源发现与跨模态合成分离,该基准暴露了现代问答系统的关键失败模式。基线评估显示,包括标准检索增强生成(RAG)和智能体工具使用方法在内,高质量的检索并不保证正确的推理。系统在元数据图的关系链推理、银行账本的政策依据以及生物医学场景的联合表格问答等方面持续遇到困难。

这些发现突显了未来智能问答系统需要更强大的发现机制和可靠的跨文件组合能力。LakeQuest为评估和改进真实世界数据湖中的问答系统提供了重要工具,推动了该领域向更实用、更鲁棒的方向发展。

数据湖问答系统基准测试RAG智能体

原文来源:https://arxiv.org/abs/2607.12310

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回