AgentFAIR:多智能体协作框架,评估地理空间数据的FAIR合规性

arXiv·1 天前

地理空间数据在城市规划、气候建模等领域应用广泛,但其FAIR原则(可发现、可访问、可互操作、可重用)的合规性评估一直缺乏统一标准。现有评估工具采用不同评分标准和证据来源,对JavaScript渲染页面或特定存储库标识符的处理能力有限,导致评估结果差异显著。研究显示,在10个存储库的50个数据集中,不同工具给出的标准化分数标准差平均达15.0个百分点,最高甚至达到30.3。

为解决这一问题,研究团队提出了AgentFAIR——一个多智能体协作评估框架。该框架结合结构化元数据提取与13个针对FAIR子原则的大型语言模型评估器,每个评估器生成0-3分的成熟度评分、引用证据和改进建议,并由一个“批评者”智能体负责检查证据一致性和发起定向重评估。

实验结果显示,AgentFAIR评估的FAIR四项原则平均得分分别为:可发现性79.7%、可访问性70.4%、可互操作性45.3%、可重用性72.0%。与四种基线工具的排名相关性在0.31至0.61之间。在重复运行的10个数据集子集上,子原则评估一致性平均达到89%,而未使用批评者机制时仅为71%。初步的15个数据集专家研究显示,评估结果与专家共识的一致性达82%。

该框架每次评估的API成本约为0.054美元,在可审计性和可行性方面表现出优势,但研究团队也指出,当前基准测试规模有限、消融实验不完整以及仅使用单一模型家族验证等因素,限制了关于准确性和泛化能力的结论。

多智能体系统FAIR原则地理空间数据LLM评估数据治理

原文来源:https://arxiv.org/abs/2607.15781

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回