测试时计算已成为提升大语言模型(LLM)能力的主要手段。现有的测试时推理方法大多依赖外部控制,要么使用固定的推理程序,要么在受限的搜索空间中进行昂贵的扩展,这限制了模型的泛化能力和效率。我们提出 思维状态(State of Thought,SoT),一种让 LLM 内部推理状态主导推理过程的新范式。具体而言,SoT 从模型内部的信息传递中提取紧凑的动力学几何状态,并在冻结的主干网络上加入一个 $582$ 参数的控制器,根据当前推理状态有选择地激活历史推理支持,将推理视为基于证据的状态条件化过程,而非外部预设的 token 链。
在 3 种 LLM 和 16 个数据集上的定量(提升 $1.34\times$)、通用($1.62\times$)、符号与代码($1.76\times$)以及长上下文($2.51\times$)推理实验中,SoT 始终提升平均基线准确率,同时将生成 token 数减少 $62.6\%$,端到端延迟降低 $44.6\%$。在 2 种视觉语言模型规模和 3 项推理任务的评测中,SoT 相比基线提升 $3.8$ 分,完成 token 减少 $74.9\%$,延迟降低 $73.5\%$,优于基于搜索的方法。即使在受限访问条件下,SoT 在无训练/仅使用嵌入的设置中仍保持 $38.2\%/36.5\%$ 的平均准确率提升,轨迹判定在 3 种 API 模型上达成 $84.1\%$ 的一致性。整体来看,内生状态驱动的推理提供了一种可推广且高效的替代方案。
点评