NeFut Logo NeFut
EN 管理员登录

[AI学术] RideWay:面向工具使用语言代理的高效任务完成基准

发布于:2026-09-17 22:00 最后更新:2026-09-18 00:46
#AI #Machine Learning #optimization

AI 代理的评估传统上只看是否完成任务,但在交互式服务中,频繁提问、冗余搜索或不必要的修改会让用户感到烦躁。为此我们提出 RideWay,一个面向网约车场景的效率导向基准,工作在有状态的工具调用环境下。基准配套 Efficiency Utility 指标,它在任务成功的前提下,对超出参考工作量的工具调用次数和用户可见回合数进行惩罚。惩罚系数通过大量人工配对偏好进行标定,反映了服务流程中的整体权衡:额外对话往往直接产生摩擦,而额外工具调用有时可以验证约束或保持用户意图。实验在 58 项任务、24 种模型上进行,得到的超额回合惩罚约为工具调用惩罚的两倍。对未见任务的偏好测试表明,Efficiency Utility 在整体上达到 78.7% 的准确率,其中在回合数不同的情况下准确率为 90.6%,而仅在工具调用数不同的情况下则接近随机水平,说明人类对工具使用的评判最为模糊。RideWay 因此实现了对交互效率的可量化评估,并揭示了基于计数的工具使用评估的局限。

点评:RideWay 为评估语言代理的实际服务质量提供了新视角,强调了效率与成功的平衡,尤其是在需要频繁调用外部工具的场景中具有重要参考价值。

原文链接: https://arxiv.org/abs/2609.17985

[h] 返回首页