互联网迷因结合了视觉线索、文本内容和文化背景,在幽默、讽刺与有害意图共存的情境中,解读变得尤为复杂。这些复杂性突显了需要可解释的迷因理解系统,以提供可靠且结构化的推理,支持准确分类和人类可解释性。然而,现有的多模态分类器要么忽视这些相互依赖关系,要么仅提供有限的可解释性。
本文介绍了MAR-12,一个新颖的框架,利用视觉语言模型(VLM)进行迷因检测和理解,特别是在幽默和仇恨元素共存的环境中。该框架首先通过十二个基于幽默和仇恨理论的结构化视角解读每个迷因。然后,它应用角色感知的软门控注意机制,学习每个视角的贡献程度,最后通过基于原型的分类器进行最终预测。
最后,利用视角特定的推理和学习的注意权重合成解释,确保透明且基于上下文的理由。我们在PrideMM和Memotion数据集上评估了MAR-12,其幽默检测准确率高达80.3%,仇恨检测准确率为75.9%,超越了现有的最先进的方法。此外,无论是人类还是基于GPT-4的评估均确认MAR-12生成了连贯且有说服力的解释,尤其是对于幽默与有害线索共存的迷因。
博主点评: MAR-12框架通过多角度的推理机制,有效地解决了幽默与仇恨内容的复杂性,为恶搞文化带来了新的理解与分析工具。这一研究不仅提高了迷因的检测准确率,同时也为理解其背后的文化脉络提供了重要视角,值得在更广泛的文本分析中推广应用。