NeFut Logo NeFut
EN 管理员登录

[AI学术] 超越置信度:面向稳定性的 LLM 推理测试时自适应

发布于:2026-09-12 22:00 最后更新:2026-09-15 01:15
#Machine Learning #optimization #LLM

测试时自适应(Test‑time adaptation)提供了一种轻量级方案,能够在不进行昂贵后训练的情况下提升大语言模型(LLM)在下游推理任务上的表现。传统做法利用预测熵(predictive entropy)作为模型内部信号,引导模型进入更高置信度的推理状态,省去外部验证器或奖励模型的需求。

然而,置信度升高并不必然等同于答案正确;LLM 常在错误推理路径上保持高度自信。我们观察到,当置信度在局部扰动下保持稳定时,高置信度更可能对应正确答案。基于此观察,本文提出 稳定感知置信度优化的测试时自适应(TASCO) 框架,在保持模型参数冻结的前提下,将局部稳定性纳入置信度驱动的自适应过程。

TASCO 通过对任务层前缀(task‑level prefix)进行轻量级优化实现局部稳定性。具体采用两种扰动策略:

实验在多种 LLM(包括开源与商业模型)和推理基准上进行评估。结果显示,TASCO 能显著提升推理准确率和 token 使用效率。行为分析进一步表明,TASCO 在局部扰动下保持置信度的平稳变化,避免了模型预测分布的过早集中。

点评:TASCO 通过将局部稳定性引入置信度优化,实现了在不改动模型权重的情况下提升 LLM 推理可靠性,为轻量级自适应提供了新思路。

原文链接: https://arxiv.org/abs/2609.11393

[h] 返回首页