摘要
大型语言模型(LLM)代理提供了一种生成性的方法,用于模拟在缺乏直接历史类比的情况下的人类行为,特别是在灾难和基础设施中断的规划中。然而,这种生成能力带来了有效性问题:个体合理的代理推理可能无法再现实证人口行为。
我们评估了实证基础是否提高了LLM代理在中断期间的统计真实性。具体而言,我们开发了一个实证基础的LLM代理框架,将来自美国社区调查的人口统计特征、来自美国时间使用调查的基线日常活动以及城市空间背景嵌入到代理初始化、记忆、决策提示和活动执行中。2024年7月在费城热浪期间进行的独立家庭调查被用作外部验证基准。
与未使用实证基础的LLM代理基线相比,基础模型在重建正常日常活动方面的表现显著提升,平均相关性从0.528提高到0.912,均方误差从0.066降低到0.008。在热浪条件下,基础模型更好地再现了调查得出的活动特征,平均相关性从0.349提高到0.836,均方误差从0.098降低到0.012。基础模型捕捉到46.4%的观察到的热浪响应幅度,而未使用基础的模型仅为20.6%。这些发现表明,实证基础可以使LLM代理成为更具统计可信度的人口行为模拟器,同时揭示了在灾害期间建模人类适应的剩余差距。
博主点评: 本文展示了通过实证基础提升LLM代理模拟现实人类行为的潜力,尤其是在极端条件下的表现显著改进。这一研究为未来的灾害模拟提供了重要的参考,强调了在模型中融入真实世界数据的重要性。通过这样的改进,LLM代理不仅能更好地预测人类行为,还能为政策制定者提供更可靠的决策支持。