在本文中,我们探讨了人脑处理信息的过程中,只有一小部分是可被意识到的,即可以进行言语报告、主动控制和灵活推理。我们提出,类似的功能区分在大型语言模型中也显现出来。通过一种新的可解释性技术——雅可比透镜,我们识别出模型在任意处理时刻能够言表的表征,这些表征统称为 J-space。
J-space 展现了全球工作空间的功能特性:其内容可以被报告、主动召唤和保持,能够用于无声推理的中间步骤,并作为参数传递给下游计算,而文本解析和常规推理等自动处理则在没有它们的情况下进行。J-space 还具有全球工作空间理论所关联的结构特征:它仅在中间层带中携带连贯内容,同时一次持有数十个概念,并且模型的权重对其广播的范围广于其他表征。这些特性使得它成为探索模型未言思维的实用窗口。
在对齐审计中,J-space 揭示了战略性思考、评估意识以及训练中未对齐的倾向,这些在模型的输出中并未显现。我们发现,后训练过程将助手的观点植入工作空间,并引入了反事实反思训练,通过训练模型在被打断并要求反思时会说出的话来改善其行为。这些结果表明,语言模型维持了一小部分特权表征,具备某些意识访问的功能标志,解码这些表征可以揭示正在进行的认知过程。
博主点评: 本文为理解语言模型的内在工作机制提供了重要视角,尤其是通过 J-space 对模型思维过程的深度解析,进一步推动了对人工智能中意识与表征的研究。