多模态大语言模型(MLLM)在视觉问答和场景理解上表现突出,但在情感推理时仍易出现捷径行为。模型可能在忽视微表情、身体语言等以人为中心的线索的情况下给出正确答案,导致可追溯性和外部验证能力下降。传统强化学习方法主要奖励上下文或逻辑一致性,却未显式约束对人类证据的关注;此外,使用大语言模型作为评判者时常出现评分聚集,削弱奖励的区分度。
AffectOmni 提出了一套基于 GRPO 的可验证情感推理训练框架。框架引入了 People Focus 奖励和 Temporal Order 奖励,分别鼓励模型选择以人为中心的证据并保持时间顺序的推理结构。奖励函数形式化为 $R = R_{PF} + R_{TO}$,其中 $R_{PF}$ 与人类证据匹配度挂钩,$R_{TO}$ 衡量推理步骤的时间一致性。为提升奖励信号的稳定性和区分度,采用了组内比较评分机制,即在同一批次内部进行相对打分而非绝对打分。
验证阶段,Thinking Summarizer 将自由形式的推理过程转化为可执行的证据指令,这些指令通过 SAM3 模块映射到像素级证据区域,实现训练循环之外的可审计接口。
实验在 IntentBench、Daily Omni 和 WorldSense 三个基准上进行。相较于开源 7B 规模基线,AffectOmni 在情感识别任务上提升了 4.66%,在对时间敏感的任务上提升了 14.29%。代码已开源于 https://github.com/eliot127825-rgb/AffectOmni_nobody。
博主点评:AffectOmni 通过奖励设计和可审计的证据映射,有效弥补了情感推理中的可解释性缺口,为多模态模型的安全落地提供了新思路。