多模态情感识别是情感计算中的核心任务,广泛用于情感分析、智能客服和人机交互。现有方法大多依赖单一模态特征或采用简单的特征拼接,难以捕捉全局语义与局部模态交互之间的协同效应,导致模型对情感的理解深度不足。
为了解决上述问题,我们提出了Transformer‑GAT混合框架。框架中,Transformer负责提取跨句子的全局语义表示,利用自注意力机制建模长程依赖;Graph Attention Network(GAT)则在模态层面构建细粒度关系图,将语音、文本、视觉等模态视为图节点,通过注意力权重学习模态之间的交互强度,从而强化情感特征的表达。两者的特征在融合层进行加权组合,实现全局信息与局部细节的平衡。
在IEMOCAP和MELD两个公开数据集上进行实验,模型分别取得加权F1得分72.45%和77.37%,显著超越当前最先进的基线方法。实验结果表明,Transformer‑GAT能够有效整合多模态信息,提升情感识别的鲁棒性和细致度,为多模态情感计算提供了新的思路。
点评