NeFut Logo NeFut
EN 管理员登录

[AI学术] DevicesWorld:异构环境中跨设备智能体基准测试的突破

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #Open Source

摘要

基于大型语言模型(LLM)的智能体在操作单一数字环境(如移动应用、桌面系统和智能家居)方面迅速提升。然而,现实世界中的用户目标常常跨越多个设备:信息可能来自手机,在桌面上处理,结果则需要在另一设备上显示。现有的大多数基准测试集中于单一主导执行环境,这使得评估智能体是否能够跨异构设备获取和整合信息并完成具有跨设备依赖的端到端任务变得困难。

为了解决这一问题,我们引入了DevicesWorld,这是一个大规模可执行的基准测试,旨在评估跨设备的协作操作。DevicesWorld包含6140个任务,并将三类设备环境——移动、桌面和物联网(IoT)——整合到一个统一的跨设备交互和评估框架中。每个任务定义了自然语言用户目标、参与设备及初始状态、可执行动作、基于规则的验证器以及清理程序。通过多阶段构建和质量控制管道,确保任务接近真实用户需求,同时允许从设备状态和生成文件中自动验证最终结果。

我们在固定评估集上评估了五个前沿的LLM智能体系统。所有方法的成功率均较低,最佳的成功率仅为12.5%。在失败的运行中,大约28.7%的案例满足至少一个评分条件,但仍未完成全部任务。轨迹显示,智能体在获取信息或操作接口时会陷入困境,混淆源设备与输出设备,或在所有条件未共同满足之前就终止任务。DevicesWorld将跨设备协作操作转变为一个可执行、可重现且具有诊断价值的评估问题,为研究可靠的跨设备智能体提供了新的方向。

博主点评: DevicesWorld为跨设备智能体的评估提供了一个系统化的框架,尽管当前智能体的成功率较低,但这一基准测试的引入无疑将推动该领域的研究进展,促使智能体在真实环境中的表现更加出色。通过不断优化和调整,未来的智能体有望在复杂的跨设备任务中实现更高的成功率。

原文链接: https://arxiv.org/abs/2607.13465

[h] 返回首页