摘要
标准的检索增强生成(RAG)流程仅通过语义相似度对检索到的文档进行排名,而未考虑源的来源和可信度。本文评估了一种简单且可解释的RAG检索排名修改方法,该方法结合了领域信息的源可靠性先验。每个文档根据其源类型被分配一个先验 $\text{lambda}(s)$,并通过以下公式重新加权检索分数: $$\text{score}(q, d) = \text{sim}(q, d) \times \text{lambda}(s)$$。 该框架在一个包含120个文档的健康领域语料库上与仅基于相似度的基线进行了评估。在这一受控环境中,源感知重排序将Precision@5从0.48提升至0.72,并在评估的威胁模型下减少了平均对抗性文档检索,其中低可信度源可以通过元数据识别。所有实验均在密尔沃基工程学院的高性能计算集群Rosie上执行,该集群提供了运行完整实验流程所需的GPU加速基础设施。这些结果表明,在所描述的实验设置范围内,源质量下降的潜在缓解策略。
博主点评: 该研究通过引入源可靠性先验,为RAG流程提供了重要的改进,显著提高了文档检索的精度。这一创新方法不仅提升了生成模型的可靠性,还为未来的研究提供了新的思路,值得关注。