摘要
在当前的多模态系统中,检测跨模态的高层语义概念(如否定)仍然是一个挑战。我们将此分析视为一个基本的表示学习问题,并提供首个证据表明,否定在标准视觉-语言模型(VLMs)的潜在空间中并不形成线性或非线性可分的类别。我们展示了预训练嵌入主要编码了模态特定的特征,缺乏可泛化的否定信号。
为了解决这一问题,我们提出了一种新颖的跨模态注意力架构,明确建模模态间的依赖关系,取得了相较于单模态基线高达 +7.03% 的 F1 性能提升。我们的分析揭示了一个关键的不对称性:文本否定往往独立出现,而视觉否定在语义上依赖于语言上下文,这一发现通过对 3,222 个政治视频-文本对的统计分析得到了验证,这些数据通过 Qwen2.5-VL 自动注释。
通过将此分析与自监督视频表示(JEPA2)结合,我们推动了时间否定建模的发展。这项工作为学习稳健且语义对齐的多模态表示提供了新的方法和见解。
博主点评: 本文揭示了多模态系统在处理否定时的潜在局限性,并通过创新的注意力机制有效提升了模型性能。这为未来的研究提供了重要的方向,尤其是在复杂语境下的语义理解上,具有广泛的应用前景。