NeFut Logo NeFut
EN 管理员登录

[AI学术] MiniCache:高效LLM推理的可重用程序缓存框架

发布于:2026-07-24 22:00 最后更新:2026-07-26 07:44
#algorithm #optimization #Open Source

大型语言模型(LLMs)在程序辅助推理、智能决策和结构化任务执行中越来越被广泛应用,但这些应用通常伴随高昂的推理成本。我们提出了MiniCache,一个可重用的程序缓存框架,它将思维程序(Program-of-Thought, PoT)转化为参数化缓存对象,从而在结构相似的请求之间实现计算重用。

MiniCache在缓存命中请求中重用相同的小模型进行语义变量提取,并在目标LLM生成时进行推测性草拟,减少了昂贵的目标LLM调用,同时保持任务质量。实验结果表明,在购物类请求数据集WebShop、Formula和CodeTAT-QA上,MiniCache在推理延迟、缓存重用和准确性之间实现了更好的平衡,最高可降低3.1倍的延迟并在并行服务下提高2.8倍的吞吐量。这些结果表明,小模型最有效的作用并不是替代大模型,而是作为轻量级接口模型,使得可靠且高效的可重用程序缓存成为可能。

博主点评:MiniCache展示了小型模型在大规模语言模型推理中的重要性,强调了高效缓存机制在降低推理成本中的作用。这一方法为未来的LLM应用提供了新的思路,尤其是在资源有限的环境中,值得深入研究与应用。

原文链接: https://arxiv.org/abs/2607.20507

[h] 返回首页