突破时间限制:大规模点时间语言模型显著缩小性能差距
传统大语言模型在训练时通常使用无时间限制的互联网语料,这导致模型可能嵌入来自未来的信息,产生前瞻性偏差。这种偏差在金融和社会科学领域的回测与因果推断中会严重影响结果的有效性。点时间语言模型通过严格按时间顺序筛选训练数据,确保每个时间点的模型只基于该时间点之前可用的文本进行训练,从而从根本上消除了信息泄露问题。
然而,现有的点时间语言模型性能通常远低于无时间限制的模型。最新研究通过扩大模型规模取得了突破性进展。研究团队在精细筛选的FineWeb数据集上,使用按时间顺序过滤的1万亿个token,训练了参数规模达40亿的解码器架构Transformer模型,构建了覆盖2013年至2024年的月度模型检查点序列。
评估结果显示,这些点时间模型在常识推理和语言理解基准测试中,性能已接近同等规模的领先开放权重模型(如Gemma-3-4B和LLaMA-7B),尽管在某些任务上仍存在性能差距。通过LoRA进行指令微调进一步提升了模型的下游可用性。研究团队开源了完整的技术方案,包括数据集构建、训练基础设施和评估代码,以支持需要严格时间有效性的研究应用,促进可复现的点时间语言建模研究。