NeFut Logo NeFut
EN 管理员登录

[AI学术] RAFM‑SER++:轻量级多模态情感识别框架用于监控系统实时行为监测

发布于:2026-09-11 22:00 最后更新:2026-09-12 06:35
#AI #Machine Learning #Neural

近期的多模态语音情感识别(SER)系统通过双向跨模态 Transformer 实现了高精度,但其计算开销限制了在对时延和资源敏感的监控系统中的部署。为了解决这一瓶颈,本文提出了 RAFM_SER++,其核心是非对称残差注意力融合机制(RAFM)。RAFM 采用单向残差注意力通道,将情感语音特征注入文本语义表示,而不需要昂贵的双向交互。框架还引入了受 BYOL 启发的跨模态对齐目标以及注意力引导的池化层,以提升多模态表征学习效率。实验在 IEMOCAP 和 ESD 两个基准上进行,RAFM_SER++ 在保持低计算开销的同时, consistently 超越了 HuBERT‑Base 基线,并在准确率‑效率权衡上优于最新的 MemoCMT。具体表现为:可训练参数减少超过 60%,推理速度达 79.60 it/s,IEMOCAP 上的 BACC 为 81.10%,ESD 上为 95.39%。这些结果表明,轻量级的非对称多模态融合是实时监控场景中替代重交互 Transformer 的有效方案。

点评:RAFM_SER++ 通过简化跨模态交互实现了显著的参数和速度优势,为资源受限的监控系统提供了实用的情感识别路径。

原文链接: https://arxiv.org/abs/2609.07409

[h] 返回首页