NeFut Logo NeFut
EN 管理员登录

[AI学术] 检索的三重维度:RAG系统中文档、查询与答案的互补性实证研究

发布于:2026-07-30 22:00 最后更新:2026-07-30 23:39
#algorithm #Machine Learning #Open Source

摘要

RAG系统依赖于分块处理,导致文档中的结构信息被破坏。现有的基于标题的检索方法(Jeong et al., 2025)需要对每个文档进行多次LLM调用,并返回匹配部分中的子块。我们提出了一种基于目录(ToC)引导的页面检索方法,它通过视觉格式推断标题,无需LLM调用,将其嵌入为并行索引,并加载完整页面部分。

在对8份企业文档(5到195页)进行的1,280种条件下,我们发现:

  1. 目录对答案质量有显著影响(d = +0.41, p = 0.031),在完整性(+0.40)和有用性(+0.40)方面的增益最大;
  2. 结合答案端验证时,其性能优于查询端分解+验证(d = +0.32, p = 0.036);
  3. 尽管每个查询仅增加2.9页,目录提供了20%的引用;
  4. 在较长文档上增益更显著(在118页文档上可达+1.50),但在8份文档上这一趋势未达到显著性;
  5. 480种条件的敏感性分析未发现显著的参数效应(全部 p > 0.38),确认默认设置接近最佳。

本研究的贡献在于方法论(一种新的零LLM成本的检索算法)和实证:提供了文档端、查询端和答案端增强互补性的因素证据,这是之前未曾研究的三方交互。

博主点评: 这一研究展现了在RAG系统中如何有效利用文档结构信息,提出的ToC引导检索方法不仅降低了LLM调用的成本,同时提高了答案质量,具有重要的实际应用价值。

原文链接: https://arxiv.org/abs/2607.24781

[h] 返回首页