脑电信号揭示语言模型与人类阅读认知的差异
语言模型的核心训练目标是根据上下文预测下一个单词,这与人类在阅读理解中的预测行为具有相似性。神经科学研究表明,单词的可预测性会影响大脑反应,这种反应可以通过毫秒级精度的脑电图(EEG)进行记录。虽然现有证据显示先进语言模型在单词预测任务上的准确率已接近人类水平,但这引发了一个更深层的问题:更高的预测准确率是否意味着这些模型真正捕捉到了人类阅读理解的认知信号?
本研究创新性地为人类和语言模型分别构建了基于两种信息指标(包括Top-1预测和惊奇度)的回归器,用于预测阅读过程中不同认知处理阶段诱发的脑电事件相关电位。研究者认为,通过建模ERP模式,可以对各种语言模型在阅读时的认知合理性进行细粒度分析。
研究结果显示,只有惊奇度这一指标可能与语言处理相关的ERP存在潜在关联,特别是在语义内容丰富的开放类词汇上。更重要的是,这一发现挑战了当前普遍假设——即通过增加参数规模和计算资源来扩展语言模型,将始终促进其与人类语言处理方式的趋同。该研究为评估语言模型的认知合理性提供了新的神经科学视角。