在认知建模中,一个核心问题是大型语言模型与人类在语言和非语言任务上的行为是否一致。与传统 LLM 不同,大型推理模型(LRM)通过可验证奖励的强化学习进行优化,目标是得到正确的推理解而非仅仅符合偏好。最近的研究(de Varda 等,2025)通过比较人类的反应时间和模型的推理轨迹,考察了人类与 LRM 的思考成本。本文聚焦于归纳推理:相较于演绎任务,其难度无法从形式结构直接推断,也不存在模型利用捷径伪装搜索的可能,为共享思考成本提供了更可靠的实验基础。实验表明,LRM 与人类在推理成本上呈现显著对齐,并且两者倾向于出现相似的错误。进一步地,使用能够让模型探索多条推理路径的解码方法,可在所测试的三种模型中提升人机思考成本的一致性。
点评