NeFut Logo NeFut
EN 管理员登录

[AI学术] 知识库补全的可信度层次标准

发布于:2026-09-24 22:00 最后更新:2026-09-28 00:49
#Machine Learning #Artificial Intelligence

知识图谱补全通常通过让模型把真实三元组排在随机扰动的三元组前面来评估,这等价于把所有未观测到的事实视为错误。然而,当待补全的对象是描述逻辑(DL)知识库而非单纯的图时,开放世界假设和演绎闭包使得这种评估方式失效:相对于已有知识库,一个候选公理可能被蕴含、矛盾或未决定。若模型无法区分逻辑不可能的公理与合理的新颖公理,它不仅准确率低,更是语义错误。

我们提出了对知识库补全模型逻辑可信度的四层标准:

  1. 判别性(Discrimination):模型能够区分已知真值与随机负例。
  2. 逻辑可接受性(Logical Admissibility):模型不会把与知识库矛盾的公理排在高分。
  3. 单调逻辑可信度(Monotonic Logical Faithfulness):在加入新公理后,模型对已有公理的评分保持单调不降。
  4. 概率逻辑可信度(Probabilistic Logical Faithfulness):模型的评分对应相对模型计数 $P(\alpha\mid\mathcal{O}) = \#(\mathcal{O}\cup\{\alpha\})/\#(\mathcal{O})$,该计数在三元组被蕴含、矛盾或未决定时分别取 1、0、介于 0 与 1 之间的值。

我们证明了上述四个标准形成严格的蕴含链:判别性 ⇒ 逻辑可接受性 ⇒ 单调逻辑可信度 ⇒ 概率逻辑可信度。

实验方面,我们在 $ EL$ 本体上评估了多种知识图谱和逻辑几何嵌入模型。测试集由推理机生成,分别包含蕴含、矛盾和未决定的公理。结果显示:排名准确率并不保证逻辑可信度;在四个层次中,没有任何模型能够全部满足。

代码已开源:https://github.com/bio-ontology-research-group/kbc。

点评:本文系统化地定义了知识库补全的逻辑可信度层次,并通过实验证明现有嵌入模型在这方面仍有显著不足,为后续研究提供了明确的评估基准。

原文链接: https://arxiv.org/abs/2609.27863

[h] 返回首页