在这篇论文中,我们探讨了大型语言模型(LLM)输出分布与训练数据之间的关系。具体而言,我们研究了LLM的下一个标记分布与给定上下文的经验下一个标记分布(ENTD)之间的一致性程度。ENTD作为一个吸引人的目标,因为它是用于预训练的下一个标记交叉熵损失的无约束全局最小值,并且是预训练语料库的一个易于解释的函数。
我们的研究发现,对于相当一部分输入,LLM的分布与ENTD几乎完全一致,并且随着模型规模和训练计算量的增加,平均一致性也在提升。然而,仍有一部分输入序列LLM与ENTD之间存在显著差异,我们考察了这些差异可能的来源,包括变换器架构、训练过程以及ENTD估计中的有限样本噪声。
更广泛地,我们希望我们的研究结果能够激励更多关于“数据中心机制可解释性”的工作,这是标准机制可解释性的补充,旨在揭开模型行为如何源于数据的黑箱,而不仅仅是如何在学习的权重中编码。
博主点评: 这篇论文深入分析了LLM输出与训练数据之间的关系,为理解模型行为提供了新的视角。通过对经验下一个标记分布的研究,作者揭示了模型在不同上下文下的表现差异,这为未来的模型优化和可解释性研究奠定了基础。