多模态情感识别需要理解言语和非言语线索之间的复杂交互。现有的方法基本上将其视为直接的输入输出映射问题,忽略了人类在解读情感时使用的因果推理。我们提出了一种新的框架——基于推理的学习(RGL),它将多模态情感识别转化为一个认知启发的推理任务。在双过程理论的基础上,我们将情感推理分解为三个方面:直觉(即刻感知,系统1)、语境(情况分析,系统2)和整合(两者的综合)。我们利用大型语言模型(MLLM)离线生成结构化的推理依据,这些依据被编码为记忆来指导模型训练,通过使内部表示与人类似的推理模式对齐。我们的最终模型在推理时不需要任何MLLM的开销。实验结果表明,RGL在IEMOCAP和MELD基准测试中实现了最先进的性能。此外,我们证明了模型的内部特征可以有效地检索出未见测试样本的语义正确的推理依据,验证了其推理能力。 博主点评: 本文提出了一种基于推理的多模态情感识别框架,通过将情感推理分解为三个方面,并利用MLLM生成结构化的推理依据,实现了最先进的性能。这种方法为多模态情感识别提供了一个新的视角和解决方案,能够更好地理解人类的情感和行为。