NeFut Logo NeFut
EN 管理员登录

[AI学术] RAG 需要索引:为何写入时编译胜过查询时解释

发布于:2026-08-24 22:00 最后更新:2026-08-29 12:04
#AI #LLM #Compiler

几乎所有在生产环境中的检索增强问答系统都隐藏着一个解释器:每一次查询时,语言模型都会重新推导原始语料的含义,却在随后将这一步的工作抛弃。虽然每个 token 的费用已经下降了几个数量级,但推理开销却在上升,因为上下文体积的增长速度快于费用的下降。这相当于现代的全表扫描,解决方案正是五十年前数据库提出的思路:在写入时一次性完成昂贵的工作,构建可维护的结构,使得读取变得廉价。只要在语料被用户访问之前就能预知其读取模式,就应该对其建立索引。

我们将这种思路称为写入时语义编译(Ingest‑Time Semantic Compilation,ISC):将语料的意义编译成可查询的基底,基底由两层耦合组成——增量维护的嵌入向量和在编译时已验证来源的原子声明,并把它视作拥有独立 DDL、维护合约、迁移合约和成本模型的一等数据库对象。

两项实验证明了 ISC 的可行性。第一,基底的维护成本随变化而非语料规模增长:增量更新的费用比完整重建低 33.7 倍,且精度保持在浮点数范围内。第二,在 500 条广播访谈转录的留出样本上,使用编译后的声明作为检索负载在所有 32 种预算‑模型组合中均取得最高准确率:在约 2.2k 读取 token 下正确率为 85.2%,而最佳块划分配置需要 16.3k token 仅达到 72.5%。唯一能够追赶的基线是结合检索与重排序的上下文块管线,它在查询路径 token 数上是编译声明的约 21 倍,但统计上与编译声明无显著差异——我们认为这正是因为该管线本身已经开始进行编译。

最后,我们展望由此开启的系统议程:从编译规划器到读取规划器,整个生态将围绕写入时的语义编译展开。

博主点评:ISC 把检索系统的核心工作前置到写入阶段,显著降低查询成本并提升准确率,为大规模 RAG 系统提供了新的设计范式。

原文链接: https://arxiv.org/abs/2608.20845

[h] 返回首页