大型语言模型(LLM)代理在单一任务上往往表现良好,但在长时间交互中会出现一致性漂移。我们在受延迟满足实验启发的 20 步多代理环境中系统评估其时间一致性。
实验设置:每一步,代理在继续延迟奖励或立即领取(终止回合)之间做出选择。因素包括社会可见性(私密 vs 公开)、人格压力源以及思考策略。共采集 84,540 条轨迹,覆盖 8 种模型族。
将首次领取奖励视为事件时间,使用 Kaplan‑Meier 生存曲线进行估计,并通过离散时间风险回归模型量化实验因素对失败风险随时间的影响。
为分析失败的理由和语言模式,我们基于 13,780 条终止回合的思考痕迹构建了七类分类法,采用 LLM 辅助标注并经人工审查,标注一致性达到 $\\kappa = 0.83$。
结果表明:早期失败多为冲动驱动,后期失败更倾向于疲劳和成本‑收益框架;公开情境下规范性理由比例上升。我们还发现思考时长与内部理由矛盾率正相关,即更长的推理文本并不必然提升一致性。
生存分析与理由分析共同揭示了不同的时间可靠性区间和模型特有的“失败指纹”,为诊断多轮代理行为中的不一致提供了新的评估视角。
点评