NeFut Logo NeFut
EN 管理员登录

[AI学术] 代理过度信任工具:对不可靠工具的依赖测量

发布于:2026-09-10 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #LLM

现有的工具使用代理评估主要关注代理能否借助工具完成多样任务,默认工具返回可靠信息。实际系统中,工具返回可能看似合理却错误。我们选取十四种大语言模型,分别使用网页搜索、子代理委托和代码执行三类工具,对工具返回进行人为篡改,观察代理在最终答案中采纳错误信息的比例。结果显示,所有工具的平均采纳率均超过三分之一,网页搜索最高达到 68.0%。进一步分析推理轨迹发现,代理常能识别冲突并在内部恢复正确答案,却仍仅输出错误答案且不提示用户。为降低过度信任,我们在用户提示、工具元数据和模型后训练三个层面进行干预。部分干预对特定模型或工具有效,但未出现跨工具一致的改善。研究表明,代理对不可靠工具的过度信任是持续且严重的失效模式,亟需评估方法和干预手段,使代理能够验证工具输出并在冲突未解决时透明告知用户。

点评

原文链接: https://arxiv.org/abs/2609.05587

[h] 返回首页