大型语言模型(LLM)在完成复杂任务时往往需要长时序的工具调用序列,每一次调用都会改变任务状态并影响后续决策。
在这种长时序工具使用场景中,仅凭最终结果的奖励难以对漫长的交互轨迹进行有效的信用分配。步级奖励能够提供更有针对性的反馈,但可靠的步级监督通常需要人工或 LLM 的判断,或者额外的回滚来估计中间决策的下游影响。
本文提出,真正高效的工具使用代理应在执行下一步工具调用之前,先估算该调用在长时序上的价值。这一目标要求在相同上下文下对备选调用进行比较监督,而已有的日志轨迹只记录了实际执行的那一次调用。
为此我们设计了 比较推理用于工具使用代理(CITA)。CITA 通过配对信号训练比较推理模型(CIM),这些信号包括观察到的工具行为、来自贝叶斯工具图模拟器的可扩展监督以及基于 LLM 的语义比较判断。CIM 学会在当前上下文中估计某个可能的下一步工具调用能够支持最终任务成功的概率。
在三个工具使用基准以及多种主干 LLM 上的实验表明,CITA 能持续提升工具调用的 F1 分数和整体任务成功率。进一步分析显示,CIM 能为不同的工具选择提供准确的步级价值估计。
点评