摘要
大型语言模型代理通过生成任务轨迹来解决问题,这些轨迹交替进行规划、工具调用和中间结果的生成。目前的评估指标将轨迹简化为一个二元成功标志,或通过精确匹配与参考进行比较。然而,成功标志无法区分有效解与偶然成功的解,也无法解释失败的原因。精确匹配则惩罚那些有效但顺序或分解方式与参考不同的计划。
为此,我们将轨迹评估重新定义为代理执行图与一组有效解图之间的距离,并通过属性依赖图上的不平衡融合 Gromov-Wasserstein 传输问题来实现这一点。结果得出的评分称为 \otap{}(Agentic Planning 的最优传输),它是一种伪度量,经过证明对保持依赖关系的重排序不变,并且对冗余步骤具有有限的敏感性。它的不平衡边际处理缺失或虚构的步骤,而无需强制匹配,其软耦合适应计划细节的变动。
在受控扰动和三个公共基准测试中,\otap{} 能够在语义仅指标得分低于随机水平的情况下,将有效轨迹与无效轨迹区分开来。当依赖图被精确恢复时,其准确性最高,而仅根据自由文本痕迹启发式推断图时,准确性则有所下降。
博主点评: 这一研究为轨迹评估提供了新的视角,通过引入结构感知的最优传输方法,显著提升了评估的准确性和可靠性,将有助于未来智能代理的性能优化。其方法论的创新性值得关注,尤其是在处理复杂依赖关系时的灵活性。