摘要
他人发起自我修复(OIR)是对话互动中的一种重要机制,接收者通过信号指出在说话、听力或理解方面的问题,从而促使前一个发言者解决这些问题。在对话代理中,准确识别这些修复发起策略对于高效应对沟通障碍至关重要。
尽管对话分析研究表明,OIR的发起伴随着言语和非言语信号,例如目光转移、面部表情、身体姿势和手势,现有的计算方法主要依赖于文本和音频。
本文提出了一种新颖的多模态模型用于OIR的检测和分类,结合了一系列来自对话分析的视觉特征。我们在两个具有不同语言和互动设置的语料库上评估了我们的方法。结果表明,视觉信息在性能上始终优于文本和音频基线,并提供了跨模态特征在两个语料库中的贡献洞见。
博主点评: 本文通过引入视觉特征,展示了多模态方法在对话修复检测中的潜力,强调了言语以外的非言语信号在沟通中的重要作用,为未来的对话系统设计提供了新的思路和方法论支持。