NeFut Logo NeFut
EN 管理员登录

[AI学术] SciExplore:评估自主智能体在科学导航与信息整合中的能力

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #LLM

在科学研究中,信息搜索与推理工作流程复杂,涉及多个异构来源。然而,现有基准主要强调一般领域的检索或静态科学问答,未能评估真实科学研究工作流程中所需的关键能力。我们推出了 SciExplore,一个旨在评估大型语言模型(LLMs)和智能体的科学信息搜索与推理能力的基准。

SciExplore 包含四种任务类型,共涵盖 103 个专家策划的任务,跨越十多个科学学科:科学数据库导航、模糊文献检索、缺失参考补全以及跨源结构化知识综合。这些任务逐步探讨从实体级推理和文档级识别到证据级扎根和领域级综合的更高层次能力。

我们在 SciExplore 上评估了十多种最先进的 LLMs 和自主智能体,结果显示性能存在显著差距,随着任务复杂性的增加,性能急剧下降,在最具挑战性的结构化综合任务上准确率极低。这些结果突显了当前模型和智能体在真实科学信息搜索场景中的重大局限性。

博主点评: SciExplore 的推出为科学信息检索领域提供了新的评估框架,能够有效地揭示当前模型的不足。随着科学研究的复杂性不断增加,未来的智能体需要更强的推理和整合能力,以适应多变的科研需求。

原文链接: https://arxiv.org/abs/2607.20926

[h] 返回首页