NeFut Logo NeFut
EN 管理员登录

[AI学术] REPAIR:通过事实验证的迭代细化解决科学检索的长尾混淆

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #LLM

精准检索科学信息面临两大瓶颈:概念分布呈长尾且文献对事实极度敏感。这导致密集检索器效果受限,且依赖大语言模型的增强容易出现幻觉。\ \ 为此我们提出 REPAIR,一个自我演化的数据增强框架,专为科学密集检索设计。框架通过循环三个核心步骤不断填补知识缺口:\ \

  1. 长尾概念诊断:分析检索错误,定位缺失的稀有概念。\
  2. API 引导的证据扩展:调用外部知识库或工具,生成与缺失概念对应的可靠文本片段。\
  3. 硬负例挖掘:在新生成的证据中挑选与查询最相似但不相符的样本,构造对比学习对。\ \ 上述过程会产生新的训练对,喂回密集检索模型,实现迭代式的自我强化。通过事实层面的锚定,模型能够在细粒度上区分相似概念,显著降低幻觉风险。\ \ 我们在材料科学和生物医学的九个基准上进行全面评估,REPAIR 相比 19 种强基线提升显著,验证了针对长尾缺陷进行事实增强的必要性。\ \ 点评
原文链接: https://arxiv.org/abs/2609.18262

[h] 返回首页