邮件助理不应因为用户用不同的表述方式而完成更少的工作。然而,大多数基准只使用单一的标准请求,导致对这种鲁棒性的评估几乎缺失。我们考察了在请求信息、可用证据和期望结果保持不变的前提下,沟通风格或英语变体的变化是否会影响助理的可靠性。我们沿五个沟通风格维度以及四种基于规则的方言条件构造了验证过的变体,并在三个基准上进行评估:一个检索增强生成(RAG)流水线和两个使用工具的智能体。间接请求在所有基准上均导致性能下降,正式请求则在两个智能体基准上表现更差。进一步分析发现,冗长的请求主要削弱词汇检索器,使相关邮件更难被找到;而间接和方言变体即使在邮件已被检索的情况下仍会导致错误。 在智能体场景中,间接和正式请求主要导致智能体遗漏必需的操作,而不是执行额外的无依据操作。这些结果表明,仅仅得到一个看似成功的回复并不足以证明鲁棒性:评估应当多样化请求表达方式,并单独衡量智能体是否完成了用户的实际工作。
点评