在这篇文章中,我们引入了“前瞻性”这一概念,探讨变换器何时做出决策,以及是什么阻止它们纠正这一决策。前瞻性是指变换器在特定任务中提前做出承诺,特定的注意力头维持这种承诺,而没有任何层能够纠正它。
我们在开放模型(Gemma 2 2B,Llama 3.2 1B)上复制了Lindsey等人(2025)的规划站点发现,并提出了五个问题:
- 规划对六种残差流方法是不可见的;在测试的方法中,只有基于CLT的引导成功。
- 单站点尖峰在最终提示令牌处的形状得以复制(Anthropic的站点是换行符;详见附加说明)。
- 特定的注意力头将决策路由到输出,这填补了在归因图中被标记为不可见的空白。
- 证据与最多16层的搜索一致,承诺在此之外,形成一种双模型假设。
- 事实回忆在不同的网络深度显示出相同的主题,重复的规划头与事实前十之间没有重叠。
前瞻性在我们测试的仅解码模型中跨任务重现:模板是共享的,而路由底层则有所不同。所有实验均在单个消费级GPU(16 GB VRAM)上运行。
博主点评: 这项研究为理解变换器模型的决策机制提供了新的视角,特别是如何在多种任务中保持一致的承诺。通过探讨不同模型的注意力头行为,作者揭示了模型内部复杂的决策过程,对未来模型的设计和优化有重要启示。