GraphCert 旨在在后训练阶段为图推理代理提供自举式监督。核心组件是 Bootstrapped Graph Quizzer,它在生成控制的引导下产生基于图的问答对,并标记支撑证据。标记后的证据会经过执行认证和语义筛选,合格的证据被规范化为 certified evidence rubrics。在随后进行的 GRPO 训练中,这些评分表同时约束答案的正确性和证据的对齐程度。
实验在 GRBENCH 的五个图推理子任务上进行,结果显示 GraphCert 在准确率和证据匹配上均优于规模更大的 LLM 代理和其他后训练方法。进一步的迁移实验表明,学习到的策略能够在异构图域间稳健转移,说明模型捕获的是通用的图推理能力而非特定领域模式。
这些发现验证了 可执行自证(executable self‑certification)是一种有效的自监督手段,可用于训练紧凑且高效的图推理代理。代码将在公开仓库中发布。
点评