当AI评测饱和后:CORE-Bench揭示的六大性能维度
在人工智能领域,当某个评测基准的准确率达到饱和水平时,传统做法往往是将其淘汰并替换为更具挑战性的新基准。然而,最新研究指出这种做法过于侧重准确率,忽视了评估智能体性能的其他六个关键维度。
研究人员以计算科学代码可复现性基准CORE-Bench Hard为案例,展示了即使在准确率饱和后,通过多维度评估仍能获得对智能体性能的深刻洞察。这些维度包括:构造有效性(如捷径问题)、分布外泛化能力、效率、可靠性、模型与框架的相对重要性,以及人机协作的提升效果。
研究发现,在CORE-Bench Hard中存在着难以预见的构造有效性威胁。为此,团队推出了改进版基准CORE-Bench v1.1和分布外任务套件CORE-Bench OOD。实验表明,尽管准确率已饱和,新基准仍能有效衡量效率、可靠性、模型性能和框架性能。
特别值得关注的是,研究人员通过小规模随机实验测量了人机协作在实际计算可复现任务中的提升效果。结果显示,人机协作带来了约两倍的显著加速——由于五分之一的人工复现任务在完成前达到时间限制,这个数字可能还被低估了。
这项研究为当前以准确率为中心的评估范式提供了更严谨的替代方案,强调在AI评测中需要建立更全面的性能评估体系。