检索增强生成(RAG)流水线可能忽略来源材料与查询的关系。我们研究了一层生成前的分流模块,将该关系视为查询依赖。该方法将规范查询族路由至增强审查,并将检索到的页面标记为通过、上下文化、排除或审查。核心技术包括四维页面评分、基于排名折扣的族聚合、保持意图的查询变体以及族持出路由器。我们使用200个真实URL的单码试点提供临时校准锚点;并在含有20,000行合成域标识的场景中进行受控工作负载分析。一个oracle页面门定义了风险覆盖目标,以供未来学习分类器使用。评估表明页面级频率无法替代族级曝光,并量化了校准如何改变场景激活。标注可靠性尚未测量,合成排名缺乏真实检索动态。最终得到的是可审计的分流方法和验证计划,而非部署审查工作负载、实时Web普遍性或下游答案质量提升的估计。
点评