新研究揭示大模型行为与训练数据的关联:追踪下一个词的分布

arXiv·4 天前

近日,一项发表在arXiv上的研究探讨了大语言模型(LLM)输出分布与其训练数据之间的内在联系。研究团队重点关注模型预测下一个词的概率分布与训练数据中实际出现的经验下一个词分布(ENTD)的一致性程度。ENTD作为预训练过程中交叉熵损失的全局最小化解,直接反映了训练语料的统计特性,具有明确的解释性。

研究发现,对于相当一部分输入序列,LLM的输出分布与ENTD几乎完全吻合,且这种一致性随着模型规模和训练计算量的增加而提升。这表明更大规模的模型能更好地捕捉训练数据中的统计规律。然而,研究也发现存在一个“长尾”现象:部分输入序列上模型分布与ENTD存在显著差异。研究者从Transformer架构设计、训练过程优化以及ENTD估计本身的有限样本噪声等多个角度,深入分析了这些差异的可能来源。

该研究提出了“以数据为中心的机制可解释性”这一新方向,旨在从数据源头理解模型行为的形成机制,而非仅仅关注权重编码方式。这一视角为理解大模型的工作机制提供了新的思路,有望推动更透明、可解释的AI系统发展。

大语言模型训练数据可解释性经验分布模型规模

原文来源:https://arxiv.org/abs/2607.14306

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回