情感识别在对话(ERC)旨在从多轮对话中辨别说话者的情绪。准确的情绪判断能够支持共情聊天机器人、心理健康辅导和教育技术等广泛应用。近年来多数方法依赖任务特定的微调,但此类模型可能利用数据集的特定线索。ERC 中一个几乎未被质疑的核心假设是:每条发言只能对应唯一且明确的情绪标签。
为检验该假设,我们在零-shot 设置下使用大语言模型(LLM),并将前文对话轮次作为上下文输入。实验发现,整体指标掩盖了系统性失误:错误主要集中在包含否定、感叹和插入语的句子上。这一模式在所有评估模型中均一致,暗示问题更多来源于基准数据而非模型本身。
我们进一步进行受控的重新标注实验,邀请四位人工标注者重新标记同一批对话。结果显示,仅有 35% 的案例达成强一致,且高一致性主要出现在中性情绪上;多数情绪类别落入低一致性区间。该现象表明,许多看似模型错误的情况实际上是标注本身的歧义,而非模型对情绪理解的不足。
因此,传统的单标签评估方式显得不足。为克服这一局限,我们提出了 LLM-as-Judge 框架:该框架不强制单一标签,而是对每种情绪在给定对话上下文中的合理性进行独立评估,从而更客观地衡量模型的情绪感知能力。
点评