摘要
企业检索增强生成(RAG)部署面临一个关键的治理缺口:虽然LLM生成成本按每个token计量,但检索层(向量存储、相似度计算和嵌入API调用)仍然是未归属的共享成本,这导致租户之间隐性交叉补贴。我们提出了“成本治理RAG”架构,该架构将无代码本的向量索引(TurboVec)与多租户LLM治理网关集成,创建一个统一的可观察性栈,使得嵌入、检索和生成成本能够按租户共同归属。
该架构利用TurboVec的确定性闭合形式内存公式,能够实现近乎精确的每租户检索成本计算,这一特性在具有非线性内存开销的图形索引中是不可用的。在云数据平台的治理边界内,部署于Snowpark容器服务的系统在100个模拟租户(1000万个向量,对数正态大小分布)中,实现了99.96%的端到端成本归属准确率,遥测开销低于查询延迟的0.04%。该架构在定价假设下,检索基础设施成本相较于管理的向量数据库服务降低了3.1-9.0倍。
我们形式化了一个三层成本模型,并证明无代码本量化使得确定性每租户成本归属成为可能,同时也消除了训练量化器中存在的共享代码本泄漏表面——后者的观察是探索性的,受到第七节中描述的限制。
博主点评: 该架构通过创新性的成本治理机制解决了多租户环境中成本透明度不足的问题,显著提高了资源利用效率,为企业级应用提供了新的思路。其引入的TurboVec方法展示了未来量化技术的潜力,值得进一步研究与实践。