摘要
大型语言模型在未受限制的互联网语料上训练,必然会嵌入来自未来的信息,这引入了前瞻性偏差,损害了金融和社会科学中的回测和因果推断的有效性。点时间语言模型通过仅训练于每个日历日期可用的文本,从根本上消除了这种信息泄露,但现有的努力通常导致模型在性能上明显落后于其不受限制的同行。
我们展示了通过规模可以显著缩小这种性能差距。我们在高达40亿参数的解码器仅变换器上训练,使用来自FineWeb的1万亿个按时间顺序过滤的标记,构建了一系列跨越2013-2024年的每月模型检查点。在一系列常识推理和语言理解基准测试中,我们的模型接近与其规模相当的领先开放权重模型(例如,Gemma-3-4B和LLaMA-7B)在未受时间限制的数据上训练的性能,尽管在某些任务上仍然存在性能差距。通过LoRA进行指令微调进一步提高了下游可用性。
我们发布了完整的管道,包括数据集构建、训练基础设施和评估代码,以支持可重复的点时间语言建模,并支持需要严格时间有效性的研究应用。
博主点评: 本研究通过大规模训练缩小了点时间语言模型与传统模型之间的性能差距,标志着在金融和社会科学领域时间有效性的重要进展。提供完整的训练流程和评估代码将极大促进相关研究的开展。