GPU 上的近似最近邻搜索(ANNS)因需要处理海量高维向量而日益受到关注。图结构索引能够提供高召回率和吞吐量,但构建时间长且存储开销大。聚类式方法构建快速、可扩展,却常需大量探针才能达到高召回,导致内存带宽和计算压力增大。
为同时实现快速索引构建、高吞吐搜索、高召回和低存储,我们提出 IVF‑RaBitQ(GPU),将聚类索引 IVF 与 RaBitQ 量化深度融合,形成完整的 GPU 原生构建与搜索流水线。构建阶段,我们设计可扩展的 GPU 原生 RaBitQ 量化,实现大规模低位编码的高速与高精度。搜索阶段,研发针对 RaBitQ 编码的 GPU 原生距离计算方案,并通过融合搜索 kernel 实现高吞吐与高召回。
该方案已集成至 NVIDIA cuVS 库,并在 cuVS Bench 多数据集上评测。结果显示,在召回率约 $0.95$ 时,IVF‑RaBitQ 的查询每秒(QPS)比最先进的图方法 CAGRA 高出 $3.0\times$,且索引构建速度提升 $14.7\times$(平均)。相较于聚类方法 IVF‑PQ,IVF‑RaBitQ 的吞吐提升超过 $4.5\times$,且无需访问原始向量进行二次排序。
博主点评:IVF‑RaBitQ 在保持聚类索引轻量优势的同时,引入低位量化和 GPU 优化计算,成功突破了传统方法在构建速度和查询吞吐上的瓶颈,是 GPU ANNS 领域值得关注的里程碑。