突破时间限制:大规模点时间语言模型显著缩小性能差距

arXiv·6 天前

传统大语言模型在训练时通常使用无时间限制的互联网语料,这导致模型可能嵌入来自未来的信息,产生前瞻性偏差。这种偏差在金融和社会科学领域的回测与因果推断中会严重影响结果的有效性。点时间语言模型通过严格按时间顺序筛选训练数据,确保每个时间点的模型只基于该时间点之前可用的文本进行训练,从而从根本上消除了信息泄露问题。

然而,现有的点时间语言模型性能通常远低于无时间限制的模型。最新研究通过扩大模型规模取得了突破性进展。研究团队在精细筛选的FineWeb数据集上,使用按时间顺序过滤的1万亿个token,训练了参数规模达40亿的解码器架构Transformer模型,构建了覆盖2013年至2024年的月度模型检查点序列。

评估结果显示,这些点时间模型在常识推理和语言理解基准测试中,性能已接近同等规模的领先开放权重模型(如Gemma-3-4B和LLaMA-7B),尽管在某些任务上仍存在性能差距。通过LoRA进行指令微调进一步提升了模型的下游可用性。研究团队开源了完整的技术方案,包括数据集构建、训练基础设施和评估代码,以支持需要严格时间有效性的研究应用,促进可复现的点时间语言建模研究。

语言模型时间序列模型训练开源模型AI研究

原文来源:https://arxiv.org/abs/2607.11889

相关阅读

AI_LectureNote:英语医学术语还原与语义保真度研究
大模型生成文本的“文学无风格”现象
大语言模型中的问题顺序效应:QQ等式审计揭示机制特性与饱和陷阱
首个吉尔吉斯语大模型基准发布:揭示低资源语言评估挑战
Scope3Trace:基于证据的Scope 3温室气体排放识别与提取框架

← 返回