在检索增强生成(RAG)中,表格作为重要知识源,其检索到的表格可能缺乏足够的证据来回答查询,这种属性称为可答性。可答性广泛关注源或源集合是否包含足够的证据,但优化语义相关性的检索模型并不能保证在单一源情况下也能满足这一要求,造成了根本性的错配。
为此,我们引入了 TCR-Bench,一个针对 RAG 中表格内容级可答性的诊断基准,围绕兄弟表格构建,即具有高度相似模式但内容细微差异的表格。在 TCR-Bench 上,我们评估的密集检索器持续表现出语义可答性差距:它们往往能够检索到正确的兄弟组,但难以准确找到其中唯一可答的表格,导致 QA 性能从 0.755(oracle)下降到 0.330(前 5 个检索结果)。
我们的分析表明,这一差距与语义累积、模式级线索依赖性和弱行列绑定有关。作为对该差距来源的诊断探针,我们测试了一个轻量级的两阶段管道,即可答性感知重排序(AAR),通过直接的查询-表格可答性判断来恢复性能:其将目标检索的前 1 名提升了从 18.2% 到 57.4%,这一巨大提升本身就是证据,表明观察到的失败在很大程度上反映了缺失的可答性验证步骤,而非模型能力的固有限制。
博主点评: 本文通过引入 TCR-Bench 基准,深入分析了表格 RAG 中的语义可答性问题,揭示了检索模型在处理相似数据时的不足。可答性感知重排序方法的提出,则为改善模型性能提供了新的思路,值得进一步探索和实践。