AI审稿系统性能大比拼:GPT-5.5领跑,但仍有提升空间

arXiv·31 天前

随着AI辅助研究给传统同行评审带来压力,新型智能审稿系统应运而生。近日一项研究对这类系统进行了全面评估,测试了包括OpenAIReview、coarse两款开源系统和Reviewer3专有系统在内的多个方案,覆盖六种大语言模型。

研究首先检验AI对ICLR/NeurIPS会议论文的评审是否与论文实际质量相符。结果显示所有系统均超越随机水平,其中OpenAIReview搭配GPT-5.5以83.0%的配对准确率位居榜首。在错误检测能力测试中,研究人员构建了包含四类错误的扰动基准数据集,覆盖八个arXiv学科领域。最佳配置(OpenAIReview+GPT-5.5)能检测出71.6%的注入错误,表明仍有较大提升空间。有趣的是,六种模型的联合检测召回率达到83.3%,提示不同模型擅长发现不同类型的错误,优化系统设计有望进一步提升性能。

除了基准测试,研究还跟踪了OpenAIReview的实际部署情况。用户对其评论的投票呈现1.44:1的正面倾向,最常见的批评集中在误报和细节挑剔方面。研究表明,虽然AI审稿系统仍需完善,但已能较好追踪人类质量判断、捕捉重要错误,并获得了真实用户的积极反馈。

AI审稿同行评审大语言模型学术出版GPT-5.5

原文来源:https://arxiv.org/abs/2606.19749

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回