摘要
多模态知识图谱补全(MKGC)需要根据结构、文本和视觉线索推断缺失的实体。现有的基于扩散的MKGC方法通常直接对原始多模态特征进行去噪。这种设计迫使去噪器同时执行与关系相关的线索选择、跨模态语义对齐和结构感知的实体生成,从而引入了嘈杂和语义不一致的条件,导致补全性能不佳。
为了克服这一局限性,我们提出了MGDT:基于关系自适应专家混合体的MLLM引导扩散变换器(MGDT),这是一个新颖的MKGC框架,建立在“先对齐再扩散”的范式上。
MGDT首先采用关系自适应语义路由混合专家(RASR-MoE)模块,选择与关系相关的多模态语义转换路径,并抑制无关模态的干扰。接着,MGDT使用一个冻结的多模态大型语言模型(MLLM)作为语义锚,将路由后的多模态表示对齐到统一的潜在空间,减少跨模态语义异质性。最后,知识图谱扩散变换器(KGDT)在对齐的空间中执行基于图的去噪生成,以产生缺失的实体表示。实验结果显示,MGDT在三个基准数据集上的表现均优于强基线。
博主点评: MGDT框架通过引入关系自适应机制和多模态对齐策略,有效解决了传统方法中的语义不一致问题,展现出强大的补全能力,值得在知识图谱相关领域进行深入研究与应用。