摘要
理解驾驶员的情感与状态对下一代智能舱内系统至关重要,这些系统旨在确保安全并增强人车互动。然而,现有的舱内情感计算公共数据集主要局限于视觉模态,鲜有包含对话信息,这使得捕捉驾驶员情感背后的语言和互动线索变得困难。为了解决这些问题,我们推出了InCarEmo,一个用于舱内情感识别和驾驶员状态监测的多模态数据集。
InCarEmo集成了RGB和红外视频、舱内音频以及从脚本化舱内场景中收集的对话文本,这些场景旨在模拟真实的驾驶行为,涵盖多种照明条件和驾驶环境。该数据集支持三项主要任务:1) 多模态情感识别,2) 疲劳检测,3) 分心监测。除了原始的中文数据外,我们还构建了辅助的英语基准,以支持初步的跨语言评估。
我们提供了一个统一的基准,包含了广泛的单模态和多模态方法的基线结果,包括在模态缺失和噪声条件下的分析。实验结果表明多模态融合的优势,并揭示了在真实世界噪声和低光条件下的挑战。通过发布InCarEmo,我们旨在建立一个全面的基础,以实现稳健、可解释且以人为本的舱内情感理解,促进更安全和更具同理心的驾驶员-车辆互动。
博主点评: InCarEmo数据集的发布为舱内情感识别领域带来了重要的突破,通过多模态信息的融合,不仅提高了情感识别的准确性,也为未来的智能驾驶系统奠定了基础。这为人机交互的进一步优化提供了丰富的数据支持,具有广泛的应用前景。