检索增强生成(RAG)流水线通常在预处理阶段固定索引和检索配置,这种一刀切的设计难以满足专家领域中查询多样、粒度不同、元数据约束各异的需求。为此,本文提出 ORDER(Optimal Routing for Dynamic Evidence Retrieval),一种根据查询动态调整索引和检索的框架。首先在问题集合上进行语义聚类,为每个簇学习对应的文本切分策略、元数据过滤以及重排序配置。推理时,使用最近中心点分配将查询路由到预构建的对应索引。为进一步提升检索效果,本文设计了监督式查询路由器 QRe,预测最可能包含相关证据的文献集合,并配合均匀多源采样器 UMS,将检索预算在选中的来源间均匀分配。实验在大规模、异构的历史档案上进行,结果表明在复杂专家域环境中,查询条件化的索引和检索同时优化能够持续超越朴素基线和多种强劲的最新 RAG 系统。
点评:ORDER 通过把查询映射到专属索引和检索策略,实现了对多源异构数据的细粒度适配,展示了在专业领域提升检索质量的可行路径。