心理化是指推断他人信念和意图以指导自身选择的能力,是人类社交互动的核心认知功能。近期大型语言模型(LLM)在理论心智任务上表现出与人类相似的行为,但其是否能够通过心理化实现适应性行为仍未可知。
本文采用两种经济博弈并结合认知计算建模,揭示 LLM 心理化背后的潜在策略。实验在四类模型家族(DeepSeek、GPT‑4.1、GPT‑5、Gemini 2.0 Flash)上分别测试 2 099 个 LLM 代理,面对不同复杂度的对手,并评估一种旨在诱导策略推理的提示策略是否提升表现。结果以 251 名人类参与者的数据作为基准进行比较。
在两项博弈中,LLM 均展现出明确的心理化行为和计算特征,但其表现随模型提供商和规模差异显著。策略性提示普遍通过引发更高层次的推理提升了性能,然而提升幅度在两项任务间存在差异。值得注意的是,GPT‑5 代理能够根据对手的复杂度灵活调整递归推理深度,最终在整体表现上超越了人类参与者。
本研究表明,不同 LLM 在心理化能力上存在显著差异,并强调认知计算建模是一种评估人机智能比较的正式方法。
博主点评:该工作通过严谨的实验设计和模型分析,提供了首批系统性证据,说明先进的 LLM 已具备可调节的心理化推理能力,未来在社会交互和人机协作领域具有广阔前景。