摘要
大型语言模型(LLMs)在通过上下文学习(ICL)预测隐藏马尔可夫模型(HMMs)的下一观察值方面表现出惊人的能力,但支撑这一能力的算法仍不明确。先前的研究提出了几种候选算法,但未能达成共识,且没有基于模型的内部激活进行验证。为此,我们提出了一个三阶段的流程。
第一阶段
我们通过实证比较LLM的行为与一系列候选算法,缩小了算法空间至三类——尽管没有单一类别能够解释LLM在所有HMM设置和序列长度上的行为。
第二阶段
我们推导了这三类算法之间的理论联系,并展示了如何通过Transformer在上下文中实现每一类,进一步在一个小型训练Transformer中验证了这一构造。
第三阶段
回到预训练LLM,我们引入了主激活探测器(PAP),这是一种逐层探测和干预方法,旨在隔离模型激活中的算法信号。PAP揭示了能够因果驱动模型预测的低维线性表示,并跟踪实证ICL性能。PAP进一步显示这些表示如何随基础HMM机制的属性而变化;不同的计算阶段被局部化到不同的层。
结合我们的结果,揭示了预训练LLM的上下文行为与其内部机制之间的联系,推动了我们对LLM如何在HMM上执行ICL的理解。
博主点评: 本文通过系统的实验和理论分析,深入探讨了LLM在处理HMM时的内部工作机制,特别是通过PAP方法揭示了模型激活的算法信号。这一研究不仅填补了现有文献的空白,也为理解大语言模型的行为提供了新的视角。