NeFut Logo NeFut
EN 管理员登录

[AI学术] EmoAgent-R1: 基于强化学习的动态代理专门化,推动多模态情感理解

发布于:2026-07-25 22:00 最后更新:2026-07-26 07:44
#AI #Machine Learning #DeepSeek

摘要

多模态大型语言模型(MLLMs)在多模态情感识别(MER)任务中表现出色,将情感理解提升到一个新高度,具备先进的视频理解能力和自然语言描述能力。然而,现有的基于MLLM的方法通常使用固定的提示来感知情感,忽视了多模态输入中情感源的动态性和复杂性。为了解决这些问题,我们提出了一种新颖的基于强化学习的动态代理专门化框架(EmoAgent-R1),旨在优化MLLM的情感识别、推理和泛化能力,利用动态代理专门化。

具体来说,我们首先采用冷启动策略,通过使用合成答案条件链式思维数据和代理路由数据进行训练,为MLLM赋予初步的情感识别、推理和代理路由能力。随后,我们进一步通过强化学习训练MLLM,以在代理选择和代理专门化的两步代理工作流中感知情感。为了有效训练EmoAgent-R1,我们提出了一种新颖的渐进组相对策略优化(P-GRPO)方法,将基于组的相对优势与受PMI启发的渐进式令牌级调制相结合,以将稀疏奖励转化为细粒度学习信号,从而缓解GRPO中的粗粒度均匀信用分配问题。大量在MER基准上的实验结果表明,EmoAgent-R1在情感推理性能和优化稳定性方面表现优越。

博主点评: EmoAgent-R1通过动态代理专门化与强化学习的结合,显著提升了多模态情感理解的能力,尤其是在复杂情感推理任务中表现突出。这种方法的创新性在于其有效解决了传统模型在动态情感源感知中的局限,未来有望在更广泛的应用场景中取得突破。

原文链接: https://arxiv.org/abs/2607.21013

[h] 返回首页