检索增强生成(RAG)是利用大语言模型(LLM)生成准确、无幻觉答案的关键技术。虽然 LLM 在处理长上下文方面已有显著提升,但仍面临“中间信息丢失”问题,因此高精度检索尤为重要。现有检索器通常将长文档切分为固定长度的块,这会丢失语料库中丰富的全局语义结构。
我们提出了全新的检索系统 STAIR,它让 LLM 能够利用文档的全局结构(如目录 Table of Contents,ToC)在模型参数中高效存储与检索信息。通过对微调的可微搜索索引(Differentiable Search Index,DSI)进行细致消融实验,发现引入 ToC 能显著降低幻觉率(<0.05%),并在训练样本极少的情况下仍保持良好泛化能力。
为推动基于 ToC 的检索研究,我们发布了 SearchTome 基准,涵盖 18 本书、6 大领域的多样化数据。实验表明,STAIR 在 SearchTome 上的 Recall@1 达到 82.6%,显著优于 DSI(76.9%),且差异具统计显著性。相较于 BM25(59.5%)和 DPR(68.7%),以及开箱即用的 Mistral(13.8%),STAIR 也表现更佳。
点评:STAIR 通过利用文档目录等全局结构,实现了低幻觉、高召回的检索效果,为 RAG 系统提供了新的方向,且其在少样本场景下的鲁棒性值得进一步探索。