NeFut Logo NeFut
EN 管理员登录

[AI学术] 小于10亿参数的多模态情感语言模型:未来的可能性与挑战

发布于:2026-07-15 22:00 最后更新:2026-07-17 08:46
#AI #Machine Learning #optimization

摘要

近期,多模态大型语言模型(MLLMs)的进展显著提升了多模态情感识别(MER)的性能,并通过联合建模视频、音频和语言等,促进了可解释性描述生成。然而,这些性能提升通常伴随着模型参数规模的增加(例如,至少7B),这导致了高计算成本并降低了推理效率,从而阻碍了在资源受限平台(如机器人和移动设备)上的实时部署。这引发了一个根本性的问题:我们真的需要超过10亿参数的多模态MER模型以实现高质量的情感识别吗?

在本文中,我们挑战了“更大模型必然更好”的假设,并提出了一种轻量级的MER框架(称为Light-MER),该框架通过知识蒸馏实现更快的多模态情感理解和识别。Light-MER能够将强大的大规模教师模型的知识转移到轻量级的亚十亿参数学生模型中,旨在保留丰富的多模态情感推理和识别能力,同时显著提高部署效率。

具体而言,我们引入了两种新的优化策略以增强知识转移:

  1. 一种新的最优传输损失,结合了切片Wasserstein距离与隐藏状态对齐;
  2. 一种基于GRPO的多奖励优化策略,平衡MER性能和效率,进一步增强学生模型的学习能力。

在九个基准数据集上的大量实验表明,Light-MER在显著提高推理效率的同时,达到了最先进的性能。这突显了小型多模态情感语言模型在未来研究中的巨大潜力。

代码可在 GitHub 获取。

博主点评: 这项研究颠覆了对大型模型的传统看法,表明通过优化和知识蒸馏,可以在不牺牲性能的情况下,显著降低模型复杂性和计算需求,为多模态情感识别的实际应用提供了新的思路。

原文链接: https://arxiv.org/abs/2607.12787

[h] 返回首页