大型语言模型(LLM)正被部署为多轮交互的智能体,需要在长时间交互中维持目标、使用工具并适应其他智能体。然而,现有研究缺乏可审计的、多轮、多因素实验来量化在明确约束下的LLM行为,也缺少时间分辨的统计来展示行为随时间的演变。为填补这一空白,我们设计了一个受斯坦福棉花糖实验启发的多智能体微基准:ReAct 智能体以分钟为单位运行,使用“提出问题”工具并受每步预算限制,同时在实验中因子化操控社会情境(广播 vs. 隔离)、人格特征(年龄、享乐驱动)以及元认知策略(强制 vs. 可选工具使用)。
我们在 19,200 条智能体轨迹、64 个实验单元上,用 Kaplan‑Meier 生存曲线和离散时间风险模型分析长期风险。结果显示,智能体在早期出现明显的“立即吃掉”冲动,只有 75.9% 的智能体坚持到结束。离散风险模型表明,隔离情境相较于广播降低了每分钟风险,而强制自问策略提升了风险。平均每个智能体提出约 $\approx 7.12$ 个问题,约 $6\%$ 的分钟触发预算上限。广播情境下提问衰减速度快于隔离。
消融实验表明,去除享乐驱动和/或年龄特征会提升存活率并缩小广播/隔离差距,但强制 vs. 可选的顺序保持不变。组合消融(无享乐 + 无年龄)实现最高完成率,接近 $1.0$。这些发现将延迟满足设为一个紧凑的多轮交互基准,捕捉社会传染和工具使用动态,为分析长时程、多智能体行为提供可复现的测试平台和统计方法。
点评