在本文中,研究者构建了 FRAIL 框架,将大型语言模型(LLM)代理置于三种动态金融场景:银行挤兑、债务展期和奖励众筹。代理的决策会改变其他代理面临的金融条件,从而产生系统性脆弱性。实验覆盖七种主流 LLM,结果显示,即使没有任何代理被指示破坏系统,仍有 77% 的银行挤兑和 83% 的债务展期情形以失败告终。为缓解这种集体脆弱性,作者比较了三种交互机制:基于补偿的承诺、中心化的承诺协议以及参与者自发的联盟。三者均提升了整体结果,但没有一种在所有金融结构中表现最佳。成功的稳定化呈现出相同的时间特征:广泛的承诺在防御行为自我强化之前形成。研究表明,单个具备能力的代理并不必然构建安全的金融系统,系统层面的评估与交互设计是金融 AI 安全的核心问题。代码已公开。
点评