AI 代理的评估传统上只看是否完成任务,但在交互式服务中,频繁提问、冗余搜索或不必要的修改会让用户感到烦躁。为此我们提出 RideWay,一个面向网约车场景的效率导向基准,工作在有状态的工具调用环境下。基准配套 Efficiency Utility 指标,它在任务成功的前提下,对超出参考工作量的工具调用次数和用户可见回合数进行惩罚。惩罚系数通过大量人工配对偏好进行标定,反映了服务流程中的整体权衡:额外对话往往直接产生摩擦,而额外工具调用有时可以验证约束或保持用户意图。实验在 58 项任务、24 种模型上进行,得到的超额回合惩罚约为工具调用惩罚的两倍。对未见任务的偏好测试表明,Efficiency Utility 在整体上达到 78.7% 的准确率,其中在回合数不同的情况下准确率为 90.6%,而仅在工具调用数不同的情况下则接近随机水平,说明人类对工具使用的评判最为模糊。RideWay 因此实现了对交互效率的可量化评估,并揭示了基于计数的工具使用评估的局限。
点评:RideWay 为评估语言代理的实际服务质量提供了新视角,强调了效率与成功的平衡,尤其是在需要频繁调用外部工具的场景中具有重要参考价值。