BenchMIRT:大模型基准测试究竟在衡量什么?
近期,研究人员在arXiv上发布了一项关于大语言模型基准测试的研究,提出了名为BenchMIRT的分析框架。该研究指出,当前广泛使用的基准测试(如MMLU、HellaSwag等)可能仅测量了模型能力的有限维度,而忽略了泛化性、鲁棒性等关键方面。通过心理测量学中的项目反应理论,研究团队发现部分测试题目存在偏差或冗余,导致评估结果无法准确区分不同模型的实际性能差异。论文建议未来基准设计应引入多维评估、动态难度调整等机制,以更科学地反映大模型在复杂任务中的真实水平。这一发现对AI社区优化模型评估体系具有重要参考价值。