摘要
近期研究探讨了知识图谱(KGs)与大型语言模型(LLMs)的结合,以提升在知识密集型任务中的表现,尤其是知识图谱问答(KGQA)。现有的方法主要通过检索增强生成(RAG)、基于代理和SPARQL的方法将LLMs与KGs结合。尽管这些方法取得了一定成功,但仍然面临结构信息丢失、不可信推理以及灵活性和泛化能力有限等问题。
为了解决这些挑战,本文提出了KG2Code,这是一种将知识图谱转化为基于代码的表示的新方法,能够保留结构语义,同时自然对接现代LLMs的代码感知预训练。基于KG2Code,进一步引入了KG2Code-QA作为KGQA框架,将KGQA表述为代码生成任务。这种表述使得生成可验证的推理轨迹和可执行代码成为可能,从而显著减少幻觉的影响。
此外,还开发了一个自动化管道,用于构建大规模、高质量的代码语料库,以有效训练开放源代码LLMs在KG2Code-QA上的表现。经过训练后,LLMs能够在零样本场景中进行KGQA。大量实验表明,所提方法在KGQA上显著优于现有的KG增强LLM方法,并在未见KG上展现出强大的泛化能力。代码和数据可在GitHub上获取。
博主点评: KG2Code通过将知识图谱转化为代码形式,为知识图谱问答任务提供了新的思路。这种创新方法不仅解决了传统方法的局限性,还通过可执行代码提高了推理的可靠性,展现了强大的应用潜力。期待看到这一方法在实际应用中的表现!