在多模态情感识别(MER)中,需要融合来自音频和文本等多个模态的互补线索来推断人类情感状态。实际场景下,情感线索往往与说话人风格、词汇内容交织在一起,而跨模态的不一致进一步增加了证据融合的难度。传统的判别式融合方法把多模态证据压缩成最终的预测,导致模态特有的线索和冲突信息难以保留。相比之下,大规模生成式情感模型通常把情感推理嵌入语言解码过程,情感证据以隐式形式存在,难以在结构化空间中进行验证。为克服这些局限,本文提出 BiCFlow-MER(Bidirectional Conditional Flow for Multimodal Emotion Recognition),将音频‑文本 MER 表述为结构化情感空间中的生成式证据传输。BiCFlow-MER 首先将情感导向的证据从说话人风格和词汇内容中解耦,构建冲突感知的情感条件。随后,在该条件的引导下,使用双向校正流将每条语句传输到显式的情感空间端点。候选情感通过两方面共同验证:一是对传输后端点进行自适应原型‑云评分,二是检查从类别回到条件的逆向一致性,以确保与原始多模态条件保持一致。该机制实现了冲突感知的情感识别。实验在 IEMOCAP、MELD 以及零样本 CASE 基准上均显著超越所有对比方法,验证了 BiCFlow-MER 在判别式识别与生成式证据建模之间的协同效应,定义了 MER 的新范式。
点评