摘要
当前的语言模型基准主要评估在完全指定任务下的执行能力。然而,真实用户的任务往往是模糊的,用户带着不完全、探索性或甚至不一致的目标到来,这要求助手首先确定用户的意图任务再进行执行。我们将这一问题研究为任务对齐:即与用户的意图任务对齐的能力。
我们提出了一个将指定任务转换为不明确交互的一般框架,形式化为部分可观测马尔可夫决策过程 (POMDP),其中模型必须从部分和不断发展的用户意图中推断潜在任务。我们通过人类用户研究对我们的用户模拟器进行了后期验证。在购物、编码和专业工作环境中,我们发现,尽管模型在任务明确时通常表现良好,但在任务对齐方面仍然存在困难:当前模型往往过早行动、交互效果不佳,并且无法解决模糊请求。在模糊情况下,模型平均仅能恢复用户意图任务的22%-32%。而在相同环境下的人类研究中,人的达成率为48%,超越了所有评估的模型。
我们展示了通过监督微调和强化学习的后训练可以改善任务对齐,但模型在通过交互解决不确定性方面仍落后于人类。总的来说,我们的结果表明,当前模型仍然缺乏可靠代理所需的关键交互能力。
博主点评: 本文揭示了当前语言模型在处理模糊用户意图时的局限性,强调了任务对齐的重要性。通过将任务视为POMDP问题,提供了一个新颖的视角和框架,这对未来的模型设计具有启示意义。模型的局限性同时也表明了人机交互领域的巨大改进空间。