摘要
文本属性图(TAGs)作为一种富有表现力的数据模型,集成了图的拓扑结构与丰富的文本语义。但现有的TAG表示学习方法在与大型语言模型(LLMs)结合时,面临严重的可扩展性瓶颈。尽管数据蒸馏提供了一个有前景的数据中心解决方案,但现有方法未能捕捉图与文本模态之间复杂的相互作用,且在半监督环境中面临标签稀缺的问题,同时缺乏生成下游LLM任务所需的人类可读文本属性的能力。
为了解决这些挑战,我们提出了\algo{},这是一个统一的半监督框架,以\text{Wasserstein Distance} (WSD) 为指导。基于我们对真实TAG的实证研究,\algo{}引入了一个图-文本协作编码模块,利用双通道编码器(图感知和无图)在协作自训练方案中收集可靠的伪标签,并融合互补的图-文本特征。
此外,我们开发了一个理论基础的基于WSD的图草图算法和一个高效的LLM文本合成模块,该模块利用基于集群的关键词提取生成连贯且人类可读的节点摘要。
在基准数据集上的广泛实验表明,\algo{}在GNN和LLM下游任务中实现了最佳的性能与压缩权衡,使得TAG学习或分析变得更加有效和高效。
博主点评: 本文提出的半监督框架通过结合图与文本特征,克服了传统方法的局限性,展示了在处理复杂数据集时的潜力。Wasserstein距离的应用为图蒸馏提供了新的视角,值得研究者深入探讨。