NeFut Logo NeFut
EN 管理员登录

[AI学术] GuardianAgentBench:揭示智能体的失误与防护策略

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#algorithm #AI #Machine Learning

随着大型语言模型智能体越来越多地独立操作,并能够访问工具和外部环境,确保其安全和可靠的行为变得至关重要。我们提出了GuardianAgentBench(GABench),这是一个包含580个场景的基准,覆盖六个领域,并在三个生产就绪的框架上进行了评估:LangChain、LlamaIndex和Vectara。该基准包含严格的多阶段验证和五种对抗攻击模式。

对六个最先进模型的实验表明,即使是最强的配置整体准确率也仅为74.8%,并揭示了两种明显的失败模式:更强的模型未能调用所需的工具,而较弱的模型则错误选择并过度调用工具。随着工具集规模和顺序回合深度的增加,性能单调下降,长时间规划的过程是更大的瓶颈。

我们的防护实现始终优于基于系统提示的防御方法,在所有模型中以仅0.5%的误报率恢复了19.9%的失败。这些结果表明,执行时的结构干预能够在不干扰正确智能体行为的情况下提高安全性。

博主点评: GuardianAgentBench的研究不仅为智能体的安全性提供了量化评估标准,还揭示了当前模型在实际应用中的不足之处。通过深入分析失败模式,研究者为未来的智能体设计提供了重要的改进方向,强调了多样化防护措施的重要性。有效的结构干预能够显著提升智能体的可靠性,值得行业内深入探讨。

原文链接: https://arxiv.org/abs/2607.20982

[h] 返回首页