首次揭秘!大模型预训练数据中的叙事结构分布规律

arXiv·31 天前

近期,一项发表于arXiv的研究首次系统分析了大规模语言模型预训练数据中的叙事构成。研究团队以开源预训练语料库Dolma(包含3万亿token)为对象,基于叙事理论构建了一个涵盖三大核心叙事要素(能动性、场景、事件)的分析框架,细分为11个可解释维度。

研究首先对400个多样化文本段落进行人工标注,随后训练并验证了基于RoBERTa的细粒度叙事预测模型NarraBERT。将该模型应用于300万段文本后,形成了新的数据集NarraDolma。分析发现三个关键结论:叙事结构在高度异质的数据中具有可测量性;网络文本底层存在连续的多维叙事结构;叙事质量在不同预训练数据源和主题间呈现不均衡分布,而当前数据筛选方法尚未考虑这一特性。

这项研究为理解叙事特征在预训练数据中的分布提供了新视角,有助于探究数据构成如何影响模型的叙事推理能力。研究团队已公开NarraDolma数据集和NarraBERT模型,为后续研究提供基础工具。该工作揭示了当前大模型训练数据中可能存在的叙事偏差,对优化数据筛选策略具有启示意义。

大模型预训练数据叙事分析自然语言处理数据集

原文来源:https://arxiv.org/abs/2606.19468

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回