摘要
目前的全双工(FD)对话系统能够实现流畅的互动,但它们是否能够根据明确指令调整轮次行为仍然不清楚。这对于实际应用至关重要,因为不同场景下的对话策略差异显著(例如,主动辅导与被动咨询)。
我们提出了 Instruct-FD,这是一个用于评估 FD 系统中可控轮次管理的指令条件基准。为此,我们开发了一个经过人类验证的、可扩展的合成管道,生成指令条件的对话,并建立了一个与部署无关的多轮评估协议以及基于 LLM 的评估者。
对六个最先进的全双工系统进行基准测试,结果显示在遵循指令的轮次管理上存在显著差距:最佳模型仅达到 64.4% 的遵循率。不同行为和场景下的表现差异明显,主动行为(如模型的反馈和打断)仍然特别具有挑战性。这些发现确立了遵循指令的轮次管理作为构建适应性和可部署的全双工对话系统的重要方向。
博主点评: Instruct-FD 的提出为全双工对话系统的优化提供了新的视角,尤其是在指令遵循的表现上。通过构建一个综合性的评估框架,研究者们可以更有效地识别和解决系统中的不足,推动对话系统的实际应用发展。未来的研究应专注于提升模型在主动行为上的表现,以实现更自然的交流体验。