NeFut Logo NeFut
EN 管理员登录

[AI学术] LakeQuest:跨数据湖的基础问答三域基准测试

发布于:2026-07-16 22:00 最后更新:2026-07-17 08:45
#AI #Machine Learning #Open Source

摘要

现代问答系统在清晰、结构化的数据集上表现优异,但现实世界的知识往往并不如此整洁。企业和科学数据湖中的问题回答需要系统能够在异构、弱结构化的表格、段落和链接元数据中进行导航。现有基准测试忽视了这一嘈杂的发现过程,未能全面评估端到端性能。为了解决这一问题,我们推出了 LakeQuest,这是一个经过人工验证的基准,包含 9,846 对问答对,旨在评估现实数据湖上的端到端检索和综合管道。

LakeQuest 涉及三个不同领域(AI/ML 元数据、零售银行和多模态生物医学药物信息),并为每个问题配备了确切的、考虑模态的证据指针。通过将源发现与跨模态综合分离,LakeQuest 揭示了现代问答系统中的关键失败模式。我们的基线评估,包括标准的检索增强生成 (RAG) 方法和代理工具使用方法,表明高质量的检索并不保证正确推理。

系统在元数据图中的关系链、银行账本中的政策基础和生物医学背景中的联合表格问答方面持续遇到困难,这突显了未来代理问答系统中对强大发现和忠实跨文件组合机制的需求。

博主点评: LakeQuest 的提出为问答系统的评估提供了新的视角,特别是在复杂数据环境下的应用。这种基准测试不仅揭示了当前系统的局限性,也为未来研究指明了方向,强调了在真实世界应用中发现和推理的重要性。通过关注多模态数据的整合,它为提升问答系统的真实表现奠定了基础。

原文链接: https://arxiv.org/abs/2607.12310

[h] 返回首页