摘要
大型语言模型(LLMs)结合工具的使用,正在成为能够利用网络引擎、API和代码解决复杂长远任务的自主智能体。目前用于学术图谱信息检索的工具使用基准,依赖于合成模板、简化的解决空间或狭窄的任务(如以论文为中心的任务),导致一些关键挑战未被充分探讨,包括:真实的用户意图、复杂的多步API规划、API的丰富参数填充、基于参考的扎实答案,以及对过程与结果的综合评估。
我们推出了AISE-Bench,这是一个面向学术知识图谱的信息检索的真实世界全周期注释基准。AISE-Bench发布包含1,133个问答对,包括查询分类、完整的API执行轨迹、验证的参数,以及带有参考链接的源基础答案。为了支持高质量的注释,我们设计了一个定制的智能体工作流,使注释者能够高效地规划、执行和修订复杂的API工作流。
我们开发了一个综合评估协议,测量答案质量、参考基础、API规划正确性和执行成功率。在14种评估方法中,即使是最强的模型(使用Gemini-3-Pro的PLAY2PROMPT)也仅取得中等性能,并且在API规划和执行方面经常面临挑战。AISE-Bench为定量评估和改善多步API使用LLM智能体的逐步正确性、扎实总结和可追溯推理建立了一个具有挑战性的测试平台。
我们的代码和数据可在 AISE-Bench GitHub 获取。
博主点评: AISE-Bench的推出为学术知识图谱领域的信息检索提供了一个全新的评估标准,尤其是在多步骤API使用的复杂性和真实性方面,弥补了现有基准的不足。其综合的评估协议也为未来的研究提供了重要的参考框架。