PHREEQC-MCQ-200:科学模拟器智能体工具增强能力诊断基准发布

arXiv·19 天前

随着大语言模型智能体越来越多地接入科学计算软件,一个重要问题亟待解答:工具访问何时真正提升科学计算的可靠性,而非仅仅增加系统复杂性?近日,研究团队在arXiv发布PHREEQC-MCQ-200基准测试,为评估工具增强型智能体在水文地球化学确定性模拟中的表现提供了标准化工具。

该基准包含200道选择题,源自21个经过验证的PHREEQC模拟场景。测试要求智能体完成完整的工作链:构建模拟器输入参数、执行PHREEQC程序、解析结构化输出结果,并最终提交准确答案。研究团队对多个前沿和中端模型家族进行了系统测试,发现模拟器访问确实显著提升了整体准确率,证实了基于实际执行的科学计算对许多任务至关重要。

然而,研究揭示了一个关键现象:性能提升并非单调递增。工具增强型智能体在某些原本无需工具就能正确回答的问题上反而出现失误,这种“性能回归”现象被整体准确率指标所掩盖。研究还发现输出访问协议的设计至关重要:目录式界面能为强模型节省计算资源并保持精度,但对中端模型却可能造成性能下降,因为它们难以可靠地导航结构化输出。

PHREEQC-MCQ-200将科学工具使用重新定义为端到端的诊断问题,而非简单的工具调用能力。研究团队主张,科学智能体的评估应当超越传统准确率指标,综合考察项目级保持能力、输出访问敏感性、轨迹失败案例以及计算链断裂的具体环节,为AI在科学计算领域的可靠应用建立更严谨的评估体系。

大语言模型科学计算基准测试工具增强智能体

原文来源:https://arxiv.org/abs/2607.00436

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回