多模态情感分析与情感识别需要同时建模文本、语音和视觉三种模态之间的异构交互。大型语言模型(LLM)在语言理解上表现强大,但直接对其进行全模型微调计算成本高昂,现有轻量级适配器在跨模态融合时往往削弱文本信息。为此我们提出多视角文本引导的多模态融合适配器(MVFA),它在保持 LLM 参数冻结的前提下,提供高效的多模态推理能力。MVFA 首先通过最大池化、平均池化和注意力池化生成互补的文本视角,这些视角随后用于引导音频和视觉特征的跨模态交互。融合后的多模态表示通过增强型 Q‑Former 融合模块压缩为一组可学习的伪 token。我们以 ChatGLM3‑6B‑base 为主干,并在 LLaMA2‑7B 与 Qwen3‑8B 上验证了框架的可迁移性。实验在 CH‑SIMS V2.0、MELD 和 CHERMA 三个数据集上进行,MVFA 在关键指标上实现了最新水平:在 CH‑SIMS V2.0 上达到 84.62% Acc2 与 84.59% F1,在 MELD 上取得 67.36% Acc 与 66.03% WF1,在 CHERMA 上获得 74.66% Acc。仅更新极少量参数即可获得这些提升,证明多视角文本引导融合是一种有效且可扩展的参数高效多模态 LLM 适配方案。代码已公开:https://github.com/Overwhelm1208/MVFA。
点评