摘要
RAG系统依赖于分块处理,导致文档中的结构信息被破坏。现有的基于标题的检索方法(Jeong et al., 2025)需要对每个文档进行多次LLM调用,并返回匹配部分中的子块。我们提出了一种基于目录(ToC)引导的页面检索方法,它通过视觉格式推断标题,无需LLM调用,将其嵌入为并行索引,并加载完整页面部分。
在对8份企业文档(5到195页)进行的1,280种条件下,我们发现:
- 目录对答案质量有显著影响(d = +0.41, p = 0.031),在完整性(+0.40)和有用性(+0.40)方面的增益最大;
- 结合答案端验证时,其性能优于查询端分解+验证(d = +0.32, p = 0.036);
- 尽管每个查询仅增加2.9页,目录提供了20%的引用;
- 在较长文档上增益更显著(在118页文档上可达+1.50),但在8份文档上这一趋势未达到显著性;
- 480种条件的敏感性分析未发现显著的参数效应(全部 p > 0.38),确认默认设置接近最佳。
本研究的贡献在于方法论(一种新的零LLM成本的检索算法)和实证:提供了文档端、查询端和答案端增强互补性的因素证据,这是之前未曾研究的三方交互。
博主点评: 这一研究展现了在RAG系统中如何有效利用文档结构信息,提出的ToC引导检索方法不仅降低了LLM调用的成本,同时提高了答案质量,具有重要的实际应用价值。