本文提出了一种名为 COMPASS 的推理引导方法,旨在在语言模型(LLM)内部发现并利用能够触发推理的潜在方向。研究表明,显式诱导推理能够显著提升 LLM 的表现,但现有方法往往依赖预先定义的 CoT(Chain‑of‑Thought)提示或通过 SAE(Sparse AutoEncoder)提取的推理特征。针对数学推理这一可验证答案的任务,作者发现仅使用模型自身直接答案的 正确性 这一信号即可构造出有效的推理方向。
该方向在大多数注意力头的激活空间中是可解码的,但只有少数头的激活能够被有效干预。为此,COMPASS 在推理时通过 logit‑space 归因分数 自动识别这些关键头,并沿着“正确性方向”对它们的激活进行微调,只需每个头的激活统计信息,无需重新训练模型。
实验在三类模型(包括 GPT‑类和开源模型)以及多个数学基准上进行。结果显示:
- COMPASS 相比基线激活干预方法提升了平均 16% 的 GSM8K 正确率;
- 在生成的 token 数量上,仅使用 20%‑70% 的 CoT token 即可达到相近的准确率;
- 该干预策略能够在未见基准上直接迁移,无需重新拟合;
- 消融实验表明,正确性方向本身以及携带该方向的少量关键头都是必不可少的,效果高度集中在极少数头上。
整体来看,COMPASS 通过极简的正确性信号揭示了语言模型内部的推理机制,并提供了一种高效、可迁移的推理激活引导手段。
点评:该工作展示了在不依赖复杂提示工程的前提下,利用模型内部信号实现推理提升的可能性,为解释性 AI 与模型调控提供了新思路。