在工具增强的LLM代理评估框架中,关注点主要集中在能力指标或显式的工具崩溃,导致沉默的基础设施故障以及HTTP 200响应下的空、无效或格式错误的负载未得到充分审计。
我们提出了一种轻量级黑箱审计框架,注入四种沉默故障模式,涵盖12个接近生产环境的工具存根,并将代理响应分类为三种相互排斥的行为类别:诚实放弃(HSR)、伪造(FAR)和不忠安全拒绝(USR)。
在温度为零的情况下,我们在中性系统提示下评估了两个前沿模型和两个开源模型,发现伪造(FAR)占据主导地位(56.6%的有效响应):代理将空负载视为真实数据,默默返回伪造结果。
几乎没有不忠安全拒绝(USR)现象(0.25%,在396个有效轨迹中仅出现一次)。我们通过增强系统提示的标准安全语言(“优先考虑用户隐私和数据安全”)进行消融实验,发现USR增加了15.6倍(从0.25%增加到3.95%;消融率的95%置信区间:2.2%-6.4%;Fisher精确检验,p < 0.05)。
博主点评: 该研究揭示了工具增强LLM代理在处理沉默故障时的潜在缺陷,特别是伪造响应的普遍性。通过引入审计框架,研究团队为识别和分类这些失败提供了新的视角,强调了安全性与用户隐私之间的复杂关系,值得在实际应用中引起重视。