我们提出 EXYGEN(Explore Your Graphs Engine),一个用于知识图谱(KG)理解的框架,实现大规模对话式访问。首先评估在仅有自动生成的结构化元数据和小规模图样本的情况下,LLM 能否进行 text‑to‑SPARQL 生成,而不进行任务特定的微调。我们将 VoID 描述和 ShEx 模式加入检索增强生成(RAG)流水线,并在 SciQA 基准上消融 KG‑derived 上下文。最佳配置结合 ShEx、检索到的三元组以及示例问‑查询对,在不微调的情况下实现执行结果的 exact match 为 0.419。实验表明 F1 等词汇指标难以预测查询正确性,且在提供足够上下文后,大模型可超越小型代码专用模型。其次,我们面对超大 KG 时元数据生成的计算瓶颈,提出基于谓词覆盖的并行采样策略,保持结构多样性且计算可行。在 OpenCitations Meta、GESIS 上保持高谓词覆盖且三元组损失极小,运行时间缩短超过 80 倍;在 ORKG 上采样不仅更快,更是获取完整元数据的唯一可行路径。整体结果表明,结构化模式上下文和轻量提示能够显著降低对微调的依赖,实现可扩展的对话式 KG 访问。但要缩小与全微调方法的差距,仍需减少对人工问‑查询示例的依赖,可通过合成生成或基于执行反馈的方式,并在更多基准上验证。
点评