语言模型的社会推理能力从何而来?训练数据溯源揭示能力起源
一项发表在arXiv上的最新研究采用创新的训练数据溯源方法,深入探究了语言模型能力的形成机制。研究团队以OLMo3-7B模型为对象,通过梯度归因技术追踪模型在社交推理和STEM推理任务上的表现与预训练数据之间的关联。
研究人员设计了一个巧妙的对比实验框架,将社会推理基准(SocialIQA和MMLU社会科学)与STEM推理基准(ARC-Challenge和MMLU STEM)进行配对比较。通过对去重后的Dolma3语料库进行细粒度分析,并按照WebOrganizer的24格式×24主题分类体系(共576个类别)进行影响力聚合,研究获得了突破性发现。
结果显示,社会推理能力和STEM推理能力实际上依赖于语料库中完全不同的区域。更值得注意的是,这种差异在推理层面比在知识层面更为显著。为验证因果关系,研究团队还进行了针对性的机器遗忘实验:当模型“忘记”高影响力主题类别(如社会推理任务中的文学类内容)时,相应基准任务的性能下降程度明显高于随机基线。
这项研究不仅为理解语言模型能力形成提供了新的方法论工具,还开源了全部代码、采样清单、类别级影响力矩阵以及遗忘检查点,为后续研究奠定了重要基础。研究结果表明,模型的不同能力可能根植于训练数据的不同子集,这为模型能力评估和针对性改进提供了新思路。