NeFut Logo NeFut
EN 管理员登录

[AI学术] 重塑轨迹评估:结构感知最优传输方法的突破

发布于:2026-07-22 22:00 最后更新:2026-07-23 12:33
#AI #Machine Learning #optimization

摘要

大型语言模型代理通过生成任务轨迹来解决问题,这些轨迹交替进行规划、工具调用和中间结果的生成。目前的评估指标将轨迹简化为一个二元成功标志,或通过精确匹配与参考进行比较。然而,成功标志无法区分有效解与偶然成功的解,也无法解释失败的原因。精确匹配则惩罚那些有效但顺序或分解方式与参考不同的计划。

为此,我们将轨迹评估重新定义为代理执行图与一组有效解图之间的距离,并通过属性依赖图上的不平衡融合 Gromov-Wasserstein 传输问题来实现这一点。结果得出的评分称为 \otap{}(Agentic Planning 的最优传输),它是一种伪度量,经过证明对保持依赖关系的重排序不变,并且对冗余步骤具有有限的敏感性。它的不平衡边际处理缺失或虚构的步骤,而无需强制匹配,其软耦合适应计划细节的变动。

在受控扰动和三个公共基准测试中,\otap{} 能够在语义仅指标得分低于随机水平的情况下,将有效轨迹与无效轨迹区分开来。当依赖图被精确恢复时,其准确性最高,而仅根据自由文本痕迹启发式推断图时,准确性则有所下降。

博主点评: 这一研究为轨迹评估提供了新的视角,通过引入结构感知的最优传输方法,显著提升了评估的准确性和可靠性,将有助于未来智能代理的性能优化。其方法论的创新性值得关注,尤其是在处理复杂依赖关系时的灵活性。

原文链接: https://arxiv.org/abs/2607.17082

[h] 返回首页