NeFut Logo NeFut
EN 管理员登录

[AI学术] 颠覆性贝叶斯重复惩罚:逆转自回归语言模型注意力崩溃的原则性框架

发布于:2026-07-29 22:00 最后更新:2026-07-30 03:24
#AI #Machine Learning #Neural

在自回归语言模型中,注意力崩溃表现为模型陷入自我强化的吸引子中,形成重复的标记循环,这是一种持久的病态,现有的解码时间启发式方法无法从根本上解决。我们提出了一种原则性框架,通过比较标记的观察频率与其语料库先验,惩罚或补偿因崩溃生成模式而产生的异常置信度,采用相邻条件概率构造。

结果得到的自归一化惩罚比率 $$R=f(m,n,p)/f(np,n,p)$$ 不需要临时标准化,且具有零近似误差的封闭形式对数偏移。该修正与损失梯度隔离,并通过指数移动平均累积到冻结的输出层偏置中,使其能够作为已经崩溃模型的修复机制,而无需对标准训练流程进行侵入性修改。实验验证表明,在一个拥有15亿参数的模型上,冻结偏置机制能够拯救已被困在崩溃吸引子中的模型,将2-gram重复率从0.073降低到接近0,同时保持生成质量。

博主点评: 本文提出的贝叶斯重复惩罚机制为解决自回归语言模型中的注意力崩溃问题提供了新的思路,通过量化和调整生成模式的置信度,显示了优越的生成质量和灵活性,值得进一步研究和应用。

原文链接: https://arxiv.org/abs/2607.22694

[h] 返回首页