在移动设备上部署大型语言模型(LLMs)作为个人助理需要满足隐私、低延迟和离线可用性等需求,但巨型模型的计算成本与严格的边缘硬件预算存在冲突。我们认为,仅通过模型压缩无法解决这一矛盾;需要将设备智能分解为互补的功能角色。我们提出了SmartRAG,这是一种完全基于设备的框架,将智能助理组织为四个协调模块——感知、记忆、聚焦和思考。
SmartRAG的核心是EvoNER,这是一种可持续学习的命名实体识别器,能够通过教师蒸馏更新逐步扩展其标签库存,使系统能够吸收以前未见的实体类型,而无需重新训练主干LLM。提取的知识存储在MRGraph中,这是一个保留来源的三层知识图谱,并通过结合图遍历、词汇匹配和密集语义搜索的混合管道在查询时进行检索。仅在高价值语义操作(如标记、规划和答案合成)时调用设备上的LLM,从而保持推理成本的可控。
在四个问答基准(TriviaQA、Natural Questions、HotpotQA、MultiHopQA)上的实验表明,使用量化的1.7B参数主干的SmartRAG在多跳推理性能上与高达18倍更大的模型竞争,同时完全在普通智能手机上运行,符合实际的内存和延迟限制。
博主点评: SmartRAG通过模块化设计和知识图谱的应用,在移动设备上实现了高效的智能助理,展现了未来边缘计算的潜力,特别是在资源受限的环境下,能够有效平衡性能与成本。其创新的EvoNER与MRGraph的结合,值得在更广泛的应用场景中进一步探索。