AI360
资讯
首页
专栏
快讯
应用中心
API 平台
#
预训练数据
1 篇相关内容
相关话题
大模型
叙事分析
自然语言处理
数据集
首次揭秘!大模型预训练数据中的叙事结构分布规律
研究者首次对3万亿token开源预训练语料库Dolma进行叙事特征分析,发现网络文本中存在连续的多维叙事结构,且叙事质量在不同数据源和主题间分布不均。
a
arXiv
·
31 天前
大模型
预训练数据
叙事分析
自然语言处理
a