摘要
LLM智能体在外部环境中执行操作,每个操作都会改变状态,后续决策依赖于这些状态,而单个错误的步骤可能会浪费交互预算或在最终失败被观察到之前触发不可逆的副作用。因此,可靠的部署要求进行步级信心估计:在执行操作之前,针对每个提议操作的有效性进行校准概率的评估。现有的LLM信心估计器设计用于根据给定提示评分,但智能体的信心还取决于执行结果:在环境响应后,相似情况下的类似操作是否真正促进了任务的完成。
我们引入了Critic Experience Bank(简称CEB),这是一种自我进化的批评框架,其中LLM批评者从其自身的过去判断及其观察到的后果中积累证据。在每次轨迹执行后,能够看到完整执行反馈的回顾性LLM对每个步骤是否有效进行投票。生成的伪标签填充到一个记忆库中,每当出现类似步骤时,相关的有效和无效经验会被检索到批评者的提示中。CEB不需要训练,也不使用真实的步骤标签。在三个智能体基准和三个批评者基础上,CEB在每个数据集-批评者组合中都实现了最佳的校准(ECE和Brier)和排名(AUC),相较于最强的无训练基线,ECE降低了高达$54\%$。
博主点评: 该研究为LLM智能体的信心评估提供了创新的解决方案,通过自我进化的批评机制提高了决策的可靠性。这种方法不仅减少了对训练数据的依赖,还显著提升了模型的表现,展现了LLM在动态环境中的潜力与适应能力。