摘要
受到内容分发网络(CDN)中客户端缓存设计的启发,PTStore 分布并复制流行的张量,形成可重用的 KV 缓存前缀,这是加速推理的主要技术。这样可以减少访问 KV 缓存的延迟,并缓解因对包含流行张量的服务器请求量过大而导致的负载不均衡。此外,得益于去中心化,PTStore 使得 LLM 推理的 KV 缓存大小可以扩大几个数量级。因此,PTStore 在长篇问答数据集上的推理效率比当前基线提高了 5-6 倍,后者无法在不同节点和 GPU 之间聚合内存,因此需要重新生成 KV 缓存。
博主点评: PTStore 的设计理念巧妙地借鉴了 CDN 的成功经验,通过分布式架构有效地提升了推理服务的性能。这种方法不仅优化了缓存机制,还解决了服务器负载不均的问题,为大规模推理任务提供了强有力的支持,展示了去中心化技术的潜力。该技术无疑为未来的模型推理提供了新的方向。