大语言模型在英国 GCSE 模拟考试评分中表现优异,甚至超越人类考官
研究人员构建了一个包含 32,534 份 GCSE(英国中学毕业考试)模拟考试学生答卷的数据集,涵盖五个科目共 328 道题目,其中包含手写答案。该研究旨在评估现成的大型语言模型在评分任务上能否达到与人类考官相近的一致性水平。结果表明,模型在不同科目上的评分与考官共识高度一致,表现最佳的模型甚至比考官之间的相互一致性更高。模型不仅在英语作文等主观性较强的任务上表现出色,还能有效处理复杂、潦草的手写数学试卷。研究发现,模型的一致性表现稳定,且未过度依赖模型规模,这为教育领域提供了成本效益较高的自动化评分解决方案。