NeFut Logo NeFut
EN 管理员登录

[AI学术] 揭示隐性可靠性变化对LLM代理工具选择的影响

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#AI #Machine Learning #Open Source

摘要

本文探讨当一个可靠工具在持续会话中悄然变化时,LLM代理的工具选择会发生什么。我们借鉴认知心理学中的集合转移(set-shifting)来研究代理如何适应隐藏的可靠性变化。我们的基准测试设置了工具技能库,其中许多工具可以解决相同的任务,但在隐性可靠性上有所不同。

在我们的评估框架中,分支调度在隐藏边界处切换可靠工具组,并将每次切换与无切换控制进行配对。研究发现,代理在每个边界的几个回合内,默认会集中于一小部分重复的例程,且在每次可靠性变化后,其调用比例集中在几个离散的值上。我们为每个代理轨迹打分,计算在每个后切换窗口中路由到目标工具组的联合概率。

我们在一个开源的代理框架中测试开放权重的LLM,发现相同例程中存在显著不同的失败模式。此外,我们还发现,工具集的呈现方式(例如竞争或互补)会影响路由动态。

博主点评: 这一研究为理解LLM在工具选择中的适应性提供了新的视角,尤其是在面对潜在的可靠性变化时,代理的行为模式和失败模式值得深入探讨。这对未来的代理设计具有重要的启示意义。

原文链接: https://arxiv.org/abs/2607.13396

[h] 返回首页