NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越深度截断:递归语言模型深度利用的受控评估

发布于:2026-09-18 22:00 最后更新:2026-09-20 12:54
#AI #Machine Learning #LLM

深度递归语言模型通过在每个 token 上循环使用同一小层堆叠,实现计算量与参数规模的解耦。该设计使得模型在推理时可以灵活调节深度,而不必增加额外参数。

传统的深度利用度评估方法是:在推理阶段人为截断模型的深度,仅保留一定比例的层,然后绘制质量随保留比例的曲线,取其斜率作为指标。该方法无需重新训练,成本低廉,却隐藏了一个关键缺陷——一次截断操作同时改变了三类属性:块的调用次数、不同计算的总量以及读出头所在的残差流是否仍在训练分布内。得到的斜率实际上混合了这三者的影响,却常被误解为仅反映计算量的变化。

为了解耦这三种因素,我们提出了深度控制协议(Depth Control Protocol,DCP)。DCP 包含三个正向控制,每个控制固定两项变量,仅让其中一项随深度变化;此外还有一个负向控制,将相同的干预施加在密集 Transformer 上,以排除测量流程本身的偏差;最后加入受控的训练干预,验证因果关系。

其中最关键的控制是:在保持块调用总预算不变的前提下,只执行一次真正不同的迭代。这一设定只能在深度共享权重的架构中实现,因为在普通密集网络中重复使用同一层会产生一个全新的模型,而不是同一模型的不同配置。

通过 DCP,我们能够分别量化块调用次数、计算多样性以及残差流分布对模型性能的贡献,从而得到对深度利用度的更可靠解释。

点评

原文链接: https://arxiv.org/abs/2609.19934

[h] 返回首页