NeFut Logo NeFut
EN 管理员登录

[AI学术] 无需训练的深度熵引导抽样:提升大型语言模型推理能力的突破

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #optimization

在大型语言模型推理能力的提升中,强化学习(RL)已成为主流方法,但其需要昂贵的训练、精心策划的数据和奖励信号。近期研究表明,在测试时从经过锐化的基础模型分布中抽样可以恢复大部分RL的优势,但现有方法仅依赖于输出层的似然性,忽视了变换器内部前向传播的动态。

我们提出了深度熵引导抽样(DEGS),这是一种无需训练的测试时方法,利用层级熵崩溃作为内在质量信号。我们观察到,强推理者(包括RL后训练的变体)表现出一种独特的“晚崩溃”现象:在更深层次之前,logit-lens解码的熵保持较高水平,随后才收敛。

我们定义了每个序列的崩溃深度 $D(\mathbf{x})$ 和一个联合目标 $\pi(\mathbf{x}) \propto p(\mathbf{x})^\alpha \exp(\beta D(\mathbf{x}))$,将序列的似然性与此深度-熵结构结合,实例化于MCMC强抽样框架(DEGS-MCMC)中。在三个开放权重模型和四个推理基准上,该近乎偶然的每候选信号在抽样轨迹上累积成最先进的无训练准确率,尤其在域外和更难的拆分上提升最大,这正是单靠似然性不足之处,且仅需单数字的时间开销。DEGS在数学拆分上略微落后于内部GRPO参考,但在GPQA的域外表现上超过了GRPO,且无需任何训练、奖励模型或标记数据。

博主点评: DEGS方法通过利用层级熵崩溃的特性,为大型语言模型的推理能力提供了一种创新的训练-free解决方案,尤其在传统RL方法难以发挥优势的场景中展现出强大的潜力。其在高难度任务中的表现尤为引人注目,预示着未来无监督学习的新方向。

原文链接: https://arxiv.org/abs/2607.09693

[h] 返回首页