SPADE是一种分布式推理框架,通过将推测解码(Speculative Decoding,SD)集成到边缘云中,以实现大型语言模型(Large Language Models,LLMs)的高效部署。 在边缘端,一个紧凑的草稿模型快速生成候选标记,而在云端,一个大型验证模型并行验证这些标记。接受的标记被保留,而只有拒绝的标记触发验证模型的更正,从而大大减少了云查询的数量。 这种设计将大部分计算转移到边缘端,显著降低了推理时间和云端成本,同时保持了大型模型的准确性,无需重新训练。 实验结果表明,SPADE在多个自然语言处理任务中将云模型调用减少了$76%$,而保持了零损失的准确性。 博主点评: SPADE 框架为大型语言模型的边缘云部署提供了一种高效且实用的解决方案,通过推测解码和分布式推理,显著降低了推理时间和云端成本,同时保持了准确性。