Transformer语言模型如何学习统计规律?研究发现:从抽象到具体
来自arXiv的最新研究采用了一种新颖的“发展心理学”视角,系统探究了神经网络语言模型(NLMs)的统计学习机制。研究团队设计了一套合成语法,并训练了一系列生成式Transformer模型,同时在训练过程中保存了多个阶段的模型状态。通过分析这些模型内部表征在“发展路径”上的变化,研究人员发现了一个有趣的学习模式:NLMs在训练初期首先掌握的是最抽象的全局统计知识,随后才逐步学习相对局部的统计依赖关系。这种学习路径伴随着大量的“过度泛化”现象——模型在早期阶段会过度应用抽象规则,而在后期训练中逐渐受到约束和精细化。基于这一观察,研究团队提出了一个新的理论框架,用以解释NLMs的统计学习过程和语言认知机制。该研究不仅为理解大语言模型的学习行为提供了新视角,也可能对认知科学和语言习得理论产生交叉启发。