NeFut Logo NeFut
EN 管理员登录

[AI学术] COMPASS:定位语言模型推理所在

发布于:2026-10-07 22:00 最后更新:2026-10-08 01:25
#AI #Machine Learning #LLM

本文提出了一种名为 COMPASS 的推理引导方法,旨在在语言模型(LLM)内部发现并利用能够触发推理的潜在方向。研究表明,显式诱导推理能够显著提升 LLM 的表现,但现有方法往往依赖预先定义的 CoT(Chain‑of‑Thought)提示或通过 SAE(Sparse AutoEncoder)提取的推理特征。针对数学推理这一可验证答案的任务,作者发现仅使用模型自身直接答案的 正确性 这一信号即可构造出有效的推理方向。

该方向在大多数注意力头的激活空间中是可解码的,但只有少数头的激活能够被有效干预。为此,COMPASS 在推理时通过 logit‑space 归因分数 自动识别这些关键头,并沿着“正确性方向”对它们的激活进行微调,只需每个头的激活统计信息,无需重新训练模型。

实验在三类模型(包括 GPT‑类和开源模型)以及多个数学基准上进行。结果显示:

整体来看,COMPASS 通过极简的正确性信号揭示了语言模型内部的推理机制,并提供了一种高效、可迁移的推理激活引导手段。

点评:该工作展示了在不依赖复杂提示工程的前提下,利用模型内部信号实现推理提升的可能性,为解释性 AI 与模型调控提供了新思路。

原文链接: https://arxiv.org/abs/2610.07469

[h] 返回首页