ISOSCI基准:揭秘大模型推理能力与知识检索的真实关系
近日,arXiv平台发布了一项名为ISOSCI的创新基准测试,专门用于评估大语言模型在科学问题解决中推理能力与知识检索的贡献度。该基准包含多组同构跨学科问题对——每组问题逻辑结构完全相同,但需要不同领域的专业知识作答。
研究团队通过对四个模型家族的五个模型对进行测试,得出关键发现:91.3%的推理模式提升实际依赖领域知识而非纯逻辑推理能力(63/69个提升案例)。这一结果直接挑战了“思维链推理能提升短期程序性科学问题解决能力”的普遍假设。
实验数据显示,即使在性能最强的模型上,开启推理模式带来的准确率提升也不超过5个百分点。更值得注意的是,专门优化的推理模型o3-mini虽然在GPQA Diamond基准上表现优异(提升19.2个百分点),但在ISOSCI测试中反而表现更差(下降24.7个百分点),表明基准选择会显著影响对推理效用的判断结论。
该研究强调,当前大模型在科学问题解决中的“推理能力提升”可能被高估,实际表现很大程度上仍受限于领域知识储备。ISOSCI基准已开源发布,为更精准评估模型真实推理能力提供了新工具。