NeFut Logo NeFut
EN 管理员登录

[AI学术] 探索前瞻性:小型变换器中的早期不可逆承诺

发布于:2026-07-21 22:00 最后更新:2026-07-22 01:01
#optimization #Attention #Transformer

在这篇文章中,我们引入了“前瞻性”这一概念,探讨变换器何时做出决策,以及是什么阻止它们纠正这一决策。前瞻性是指变换器在特定任务中提前做出承诺,特定的注意力头维持这种承诺,而没有任何层能够纠正它。

我们在开放模型(Gemma 2 2B,Llama 3.2 1B)上复制了Lindsey等人(2025)的规划站点发现,并提出了五个问题:

  1. 规划对六种残差流方法是不可见的;在测试的方法中,只有基于CLT的引导成功。
  2. 单站点尖峰在最终提示令牌处的形状得以复制(Anthropic的站点是换行符;详见附加说明)。
  3. 特定的注意力头将决策路由到输出,这填补了在归因图中被标记为不可见的空白。
  4. 证据与最多16层的搜索一致,承诺在此之外,形成一种双模型假设。
  5. 事实回忆在不同的网络深度显示出相同的主题,重复的规划头与事实前十之间没有重叠。

前瞻性在我们测试的仅解码模型中跨任务重现:模板是共享的,而路由底层则有所不同。所有实验均在单个消费级GPU(16 GB VRAM)上运行。

博主点评: 这项研究为理解变换器模型的决策机制提供了新的视角,特别是如何在多种任务中保持一致的承诺。通过探讨不同模型的注意力头行为,作者揭示了模型内部复杂的决策过程,对未来模型的设计和优化有重要启示。

原文链接: https://arxiv.org/abs/2604.15010

[h] 返回首页