摘要
在设备上的大语言模型推理面临响应延迟、硬件资源有限和用户隐私三者之间的困境。完全依赖云推理虽然提供强大的计算能力,但会暴露用户的提示和对话数据;而独立的设备推理对于大多数消费者和嵌入式边缘设备来说是不可行的。本文提出了一种基于终端认证的 KV 缓存的隐私中心边缘云协作 LLM 推理框架。
框架设计
在该框架中,局部终端负责输入预处理、嵌入计算、自适应特征优化、KV 缓存认证、推测解码和低维模型头计算,而云端则进行认证的解码推理、KV 缓存管理、令牌验证和高维词汇投影。终端融合部分输出,应用语言自适应掩码并采样目标令牌。
数据隐私保护
所有传输的数据和截断的对数都经过量化和 AES-GCM 加密以保护隐私,核心轻量级模块、草稿参数和缓存访问策略保持本地,以避免泄露。该框架支持包括仅 CPU、配备 GPU 和嵌入式设备在内的异构设备,采用优化的流处理、批处理和量化 ONNX 部署。
性能评估
评估结果表明,该框架在每个令牌延迟方面相比于基线分割推理减少了高达 46.1 ext{%},下行负载减少了高达 67.4 ext{%},同时保持了与完全云推理相当的性能。
博主点评: 该框架通过有效地结合边缘计算与云计算,解决了隐私与性能之间的矛盾,展现出极大的应用潜力,尤其适合对用户数据保护有高要求的场景。其优化的流处理和量化技术为 LLM 的广泛应用提供了新的思路。