AI审稿系统性能大比拼:GPT-5.5领跑,但仍有提升空间
随着AI辅助研究给传统同行评审带来压力,新型智能审稿系统应运而生。近日一项研究对这类系统进行了全面评估,测试了包括OpenAIReview、coarse两款开源系统和Reviewer3专有系统在内的多个方案,覆盖六种大语言模型。
研究首先检验AI对ICLR/NeurIPS会议论文的评审是否与论文实际质量相符。结果显示所有系统均超越随机水平,其中OpenAIReview搭配GPT-5.5以83.0%的配对准确率位居榜首。在错误检测能力测试中,研究人员构建了包含四类错误的扰动基准数据集,覆盖八个arXiv学科领域。最佳配置(OpenAIReview+GPT-5.5)能检测出71.6%的注入错误,表明仍有较大提升空间。有趣的是,六种模型的联合检测召回率达到83.3%,提示不同模型擅长发现不同类型的错误,优化系统设计有望进一步提升性能。
除了基准测试,研究还跟踪了OpenAIReview的实际部署情况。用户对其评论的投票呈现1.44:1的正面倾向,最常见的批评集中在误报和细节挑剔方面。研究表明,虽然AI审稿系统仍需完善,但已能较好追踪人类质量判断、捕捉重要错误,并获得了真实用户的积极反馈。