在边缘硬件上运行语言模型可以实现私密、低延迟且无需网络的推理,但能够在此类设备上部署的模型体积小,往往在算术、代数和形式逻辑等本应擅长的任务上表现不可靠。我们认为,这种不可靠性大多是可以避免的。许多看似需要推理的查询实际上具有确定性的结构,能够通过快速且精确的符号方法求解。强行让概率模型近似这些查询会以牺牲准确性和能耗为代价,却收效甚微。
为此我们提出了一种神经符号路由器(neurosymbolic router),它首先对每个输入查询进行分类,然后将其分配给成本最低且能够保证正确性的求解器:结构化任务交给确定性引擎,开放式文字题交给小语言模型(SLM)。路由逻辑不再手工编码,而是通过 L* 文法推断算法学习得到的确定性有限自动机(DFA)。在学习过程中,SLM 充当成员查询(membership oracle),标记数据提供等价查询(equivalence oracle)。
实验在 Raspberry Pi 4B(8 GB RAM,无 GPU)上进行,使用 DeepMind Mathematics、GSM8K 与 RuleTaker 各 100 条未见过的提示。学习得到的路由器实现了 100% 的路由准确率,整体准确率达到 98.3%(在 512 token 推理预算下,文字题准确率为 93.3%),显著优于最强基线 Program‑of‑Thought(72.0%)和同等求解器的工具调用代理(58.7%)。由于格式化查询从不进入模型,路由器的响应时间为 1‑11 ms;在 30 token 配置下,其速度比 Program‑of‑Thought 快 8.8 倍,能耗降低 2.8 倍。
关键技术
- 使用 L* 算法自动构建 DFA,实现查询的确定性分类。
- 将 SLM 作为成员查询 oracle,利用标记数据进行等价性验证。
- 通过模块化的符号求解器和小语言模型,实现资源受限设备上的高效混合推理。
点评