NeFut Logo NeFut
EN 管理员登录

[AI学术] DeepLoop:循环变换器的深度扩展革命

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#algorithm #optimization #Neural

在这篇论文中,DeepLoop 提出了循环变换器(Looped Transformers),通过采用紧凑的物理块堆栈来扩展顺序计算,从而在不增加存储参数的情况下增加展开深度。这种重用方式改变了残差缩放问题:在未绑定的变换器中,每个残差分支接收并应用其自己的参数更新,而在循环变换器中,一个共享的更新聚合来自重复访问的梯度,并在下一个线性化前向传递中被这些相同的访问读取。

我们通过一个受访问对齐系数 $\kappa_R$ 控制的一阶扰动界限来形式化这种绑定深度效应。当访问去相关时,这个界限恢复了 DeepNorm 指数,但在保守对齐的情况下,它要求随着循环次数在固定物理深度下增加,指数从 $1/4$ 提高到 $1/2$。

最终的方法,DeepLoop,保持了 Post-LN DeepNorm 架构,并设置了 $\alpha=(2N)^{1/2}$ 和 $\beta=(8N)^{-1/2}$ 用于展开深度 $N$。在 GPT 风格的循环语言模型(如 GPT-2 small 和 GPT-2 medium)上,当没有物理块被重新访问时,DeepLoop 的表现是中性的;一旦激活递归深度,它改善了验证损失和下游准确性。这些结果表明,稳定的递归深度需要考虑参数访问的残差缩放规则,而不仅仅是名义层数。

博主点评: DeepLoop 的提出为循环变换器的设计提供了一种全新的视角,特别是在处理深度扩展和残差缩放问题方面。通过引入共享更新机制,DeepLoop 有效地改善了模型的性能,尤其在深度递归场景下,展现出显著的优势。对于深度学习领域的研究者而言,这一方法值得深入探索与应用。

原文链接: https://arxiv.org/abs/2607.13491

[h] 返回首页