NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示大型语言模型行为与训练数据的深度联系

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#AI #Machine Learning #LLM

在这篇论文中,我们探讨了大型语言模型(LLM)输出分布与训练数据之间的关系。具体而言,我们研究了LLM的下一个标记分布与给定上下文的经验下一个标记分布(ENTD)之间的一致性程度。ENTD作为一个吸引人的目标,因为它是用于预训练的下一个标记交叉熵损失的无约束全局最小值,并且是预训练语料库的一个易于解释的函数。

我们的研究发现,对于相当一部分输入,LLM的分布与ENTD几乎完全一致,并且随着模型规模和训练计算量的增加,平均一致性也在提升。然而,仍有一部分输入序列LLM与ENTD之间存在显著差异,我们考察了这些差异可能的来源,包括变换器架构、训练过程以及ENTD估计中的有限样本噪声。

更广泛地,我们希望我们的研究结果能够激励更多关于“数据中心机制可解释性”的工作,这是标准机制可解释性的补充,旨在揭开模型行为如何源于数据的黑箱,而不仅仅是如何在学习的权重中编码。

博主点评: 这篇论文深入分析了LLM输出与训练数据之间的关系,为理解模型行为提供了新的视角。通过对经验下一个标记分布的研究,作者揭示了模型在不同上下文下的表现差异,这为未来的模型优化和可解释性研究奠定了基础。

原文链接: https://arxiv.org/abs/2607.14306

[h] 返回首页