NeFut Logo NeFut
EN 管理员登录

[AI学术] 深度递归变换器中的每个Token固定点收敛研究

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:18
#algorithm #optimization #Neural

摘要

深度递归变换器通过权重绑定核心以可变次数应用,之前的研究表明,使用随机递归次数进行训练可以生成一个可在多个推理深度中使用的检查点。我们探讨了这样的模型每个Token实际计算的内容,并直接进行了测量。在一个基于FineWeb-Edu训练的135M级模型上,递归状态收敛到每个Token的固定点:连续输出的KL散度从第二次循环的3.9e-1降至第十六次的8.5e-6,且每个Token的状态变化逐步减小。

关键的是,这种收敛在不同Token间并不均匀。中位数Token在第六次循环时收敛,而大约10%的Token在训练的平均深度八仍在更新,且平均收敛深度按Token类型排序(空格最浅,内容词最深)。这种每个Token的变化是论文的核心对象。我们表明,这种变化是可直接读取的,且其读取效果优于学习预测:一种训练无关的规则,一旦每个Token的输出稳定便停止,能在4.94次平均循环下实现均匀的深度8质量(平均深度减少38%),并在平均深度范围内匹配均匀深度,而从同一模型中收集的收敛标签训练的线性路由器几乎需要全深度,且未能实现减少。

使这一切成为可能的弹性在这里重现为背景(验证损失从一次循环的3.80单调降低到八次的3.20,并在32次循环时保持稳定)。我们报告的平均深度作为FLOP代理,使用三点墙钟括号而非实现的加速,未做FLOP匹配的平价声明,并注意到分配结果是在单一规模和种子下建立的。完整的研究在单个RTX 4090上运行,约需100 GPU小时。

博主点评: 本文深入探讨了深度递归变换器中每个Token的收敛特性,展示了如何通过简单的读取机制替代复杂的学习过程,显著提高模型效率。这样的研究不仅为模型优化提供新思路,也为后续的深入研究奠定了基础。

原文链接: https://arxiv.org/abs/2607.14427

[h] 返回首页