在上下文学习(In‑Context Learning, ICL)框架下,大语言模型(LLM)智能体可以利用交互历史提升决策质量。然而,这种提升是源自内部的递归推理,还是对历史统计模式的简单外推,仍未得到明确区分。为此,我们将 LLM 智能体置于需要递归信念推理的多智能体不完全信息博弈中进行实验。
我们构造了一个公共物品博弈,并有意扰动历史反馈的统计结构,以此检验智能体在不同上下文长度下的决策表现。决策质量以历史无关的理性预期均衡(Rational Expectations Equilibrium, REE)作为基准进行比较。
实验结果显示:当历史统计模式被破坏时,较长上下文带来的优势几乎消失,决策质量退化至无上下文基线,而且这种退化在战略相互依赖更强的情形下表现得更为显著。
这些发现表明,在高度相互依赖的战略环境中,ICL 的行为更倾向于统计外推,而非真正的递归推理。我们的工作将 ICL 的机制研究拓展到多智能体博弈场景,首次将 REE 用作区分推理与外推的诊断工具,并提供了一个可复用的实验框架,用于探测 LLM 在递归信念任务中的推理边界。
点评:本文通过精心设计的公共物品博弈,揭示了 LLM 在多智能体决策中更依赖统计模式而非深层推理,为后续提升模型的真实推理能力指明了方向。