随着大型语言模型(LLM)智能体的发展,它们的操作轨迹变得越来越复杂,涉及用户指令、工具使用、外部观察和内存。现有的基准主要评估行为结果,但对于细粒度的归因分析支持有限。我们提出了轨迹归因的概念,并开发了一个基准和标注框架。该基准组织了异构轨迹在统一的组件模式下,并提供了主要归因组件的标注,以及攻击和执行链的标注。使用AgentDojo和Stage和Canary设置的Agent3Sigma轨迹,我们获得了超过1,300个标注轨迹,涵盖了任务对齐的动作、不安全的动作和安全拒绝。基准定义了两个评估任务:主要归因定位和归因链恢复,并提供了基于增量轨迹贡献和组件级别留一法干扰的参考基线。它捕获了多种归因设置,包括局部和长距离归因以及结构化归因链。参考基线结果在这些设置中表现出显著的性能差异,提供了对基准归因挑战的初步描述。除了这个初始实例化,我们发布了一个可重用的标注技能,能够使新智能体模型生成的轨迹标准化、标注和在同一框架下评估。项目资源和未来版本可在https://github.com/chenjing-2024/agent-trajectory-attribution找到。博主点评: 该研究对长视野智能体轨迹归因进行了深入的探讨,提出了一个统一的基准和细粒度标注框架,为智能体的归因分析提供了一个新的视角和工具。