在大型语言模型(LLMs)设定了零-shot推理基准的同时,其部署成本高昂且对环境有负担。小型语言模型(SLMs)成为了一种可持续的替代方案,但在需要复杂多跳逻辑推理的任务中容易出现错误。
我们研究了一种神经符号代理框架,以增强SLMs(特别是Gemma 3(1B,4B)和Llama 3.2(3B))的推理能力,使用CLUTRR亲属关系基准。我们的方案将SLM转化为一个简约代理,利用两个专业工具调用:extract_facts用于符号三元组提取,get_hint通过关系图卷积网络(RGCN)实现专家推理。
我们在两种配置下评估这些模型:一种是基于真实三元组的Oracle情景,另一种是依赖自提取知识的现实情景。结果显示,RGCN衍生的提示在故事基线之上提供了1.5到2倍的性能提升,但系统受到提取瓶颈和顺序推理脆弱性的制约,早期提取错误在多跳链中会累积。
此外,我们还识别出在特定架构中存在“干扰效应”,即噪声自生成的事实会在存在专家提示的情况下降低性能。本研究描述了低资源代理系统中符号基础的挑战,并为神经符号代理管道中的迭代验证提供了路线图。
博主点评: 本研究展示了小型语言模型在推理任务中的潜力,尤其是通过知识图谱的结合来提升其表现。尽管存在提取瓶颈和干扰效应,框架的设计为未来的研究提供了重要的启示,值得关注。