NeFut Logo NeFut
EN 管理员登录

[AI学术] T²MLR: 变换器中的时间中层递归新突破

发布于:2026-07-18 22:00 最后更新:2026-07-22 01:02
#AI #Machine Learning #DeepSeek

在变换器模型中,推理能力受到自回归解码的限制,这导致丰富的隐藏计算在标记空间中被反复压缩,从而使得中间推理状态难以跨时间持久化。

为此,我们提出了具有时间中层递归的变换器(T²MLR),这是一种基于变换器的潜在推理架构,能够将来自前一个标记的缓存中层表示直接融合到当前标记位置的早期层中,使得抽象的中间计算能够在解码步骤中持续存在,且几乎不增加推理开销。

在自然语言预训练和多跳推理微调任务中,T²MLR始终优于数据和参数匹配的变换器基线。此外,仅在局部中层块(网络的20%)应用递归,往往也能超越全层递归。

重要的是,T²MLR不需要从头开始预训练:将递归路径融入现有的1.7B变换器并进行短暂的微调,显著提升数学推理能力,降低了实际应用的门槛。这些结果表明,在变换器中,有效的潜在推理并不需要像之前的工作那样遍历所有层,而是可以更强烈地从目标中层递归中涌现。

博主点评: T²MLR的提出为变换器模型的推理能力提供了新的视角,通过中层递归的设计有效地解决了传统自回归解码的局限性,展示了深度学习在自然语言处理领域的创新潜力。未来的研究可以在此基础上进一步探索更高效的模型架构。

原文链接: https://arxiv.org/abs/2607.15178

[h] 返回首页