NeFut Logo NeFut
EN 管理员登录

[AI学术] 循环 Transformer 在雅可比视角下:全局工作空间在递归中是否存活?

发布于:2026-09-03 22:00 最后更新:2026-09-04 02:14
#AI #Machine Learning #Neural

近期研究在标准前馈 Transformer 中发现了一段中层深度的可语言化、因果强大的表征带,被视为全局工作空间的功能类比。尚不清楚当深度通过递归而非独立层堆叠实现时,这一工作空间功能是否仍然出现。循环 Transformer 和深度递归 Transformer 直接检验该问题,因为它们在深度上复用同一套权重。我们通过虚拟展开适配器将雅可比视角(Jacobian lens)扩展到迭代结构,并对三种模型应用完整的工作空间套件——包括镜头拟合、读取以及十一类因果实验。

实验对象包括 Ouro-2.6B(48 层循环 4 次,深度监督)、Huginn-0125(4 层核心递归 16 次,针对潜在推理训练)以及 Qwen3.6-27B(64 层未绑定,作为标准基线)。结果显示,迭代部分均会形成工作空间,但递归方式改变了对其的访问方式。Ouro 在每一次循环中都会重建工作空间内容,线性传输无法跨循环边界携带该内容,因此写入和消融必须覆盖所有剩余循环。相对地,Huginn 能在全部十六次递归中保持内容向前传播,但读取、写入和消融仅在约两次递归的滑动窗口内起作用。

进一步观察发现,新注入的内容能否被语言化取决于显式的每次迭代监督,而已有内容是否能被引导则不受此影响。

点评

原文链接: https://arxiv.org/abs/2609.01924

[h] 返回首页