NeFut Logo NeFut
EN 管理员登录

[AI学术] 打破限制:通过拓扑正则化侧路径缓解大型语言模型的表示崩溃

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #optimization

摘要

大型语言模型(LLMs)面临着表示崩溃的根本限制,这一瓶颈严重影响了其长上下文的表现。我们识别出现有方法可能会陷入两种病态极端:同质化崩溃(例如,注意力沉没导致秩缺失)和孤立崩溃(例如,局部注意力导致上下文断裂)。

通过对注意力动态的谱分析,我们得出了一种内在的权衡关系,即混合效率(谱间隙)与信息容量(有效秩)之间的平衡,而标准机制对此难以把握。

为了解决这一困境,我们提出了拓扑正则化侧路径(TRSP),这是一种非侵入式的架构干预,旨在实现谱平衡。TRSP采用无参数的三角盒机制,结合轻量级的、长度感知的门控,来正则化令牌交互的拓扑结构。

通过整合近端耦合以保持有效秩和远端传播以支持非退化混合,TRSP促进了几何上更健康的过渡算子,而不改变核心注意力。

实验结果显示,TRSP在通用能力和长上下文基准测试中均取得了显著的改进。特别是在 NoLiMa 数据集上,以 $8\times$ 的训练长度,TRSP 保持了 $83\%$ 的准确率,分别超越了差异变换器和门控注意力约 30 和 50 个百分点。代码可在此获取:GitHub.

博主点评: 该研究针对大型语言模型的表示崩溃问题,提出了创新性的拓扑正则化方法,显著提升了模型在长上下文处理上的效果,展现了在深度学习架构设计中结合数学与几何的潜力。其对比实验结果也进一步验证了方法的有效性,具有重要的应用前景。

原文链接: https://arxiv.org/abs/2607.20484

[h] 返回首页