摘要
计算机使用代理(CUAs)越来越多地通过桌面GUI完成长时间任务。目前的基准主要测量最终任务成功率或单帧定位,未能有效判断模型是否能够重建由某个动作产生的因果、任务相关的转换。这一点至关重要,因为它有助于拒绝过时的观察、验证进度和从失败中恢复。然而,由于推理、远程输入、应用程序渲染和屏幕截图捕获是异步的:下一次观察可能会延迟、被遮挡、瞬时或无关,导致错误地被解读为进展,并带入后续规划。
我们引入了桌面-增量基准(DDB),这是一个离线逐步基准,包含来自约15个应用程序和50个任务领域的2,013个经过人工验证的实例,来源于新颖的多应用Linux轨迹。DDB轨迹针对3个失败维度——状态验证、源跟踪和上下文感知控制——通过2个互补任务实现:463个三帧时间顺序实例(包括105个带有跨轨迹诱饵的实例)和1,550个标记的前后对,涵盖5个动作及其有效载荷。
我们评估了8个封闭和开源模型家族,在32个顺序和16个单一动作设置中观察到一致的差距。顺序识别仍未饱和:最佳非诱饵和诱饵的准确匹配率分别为65.1%和65.7%。任务上下文提高了诱饵识别率6.9个百分点,但非诱饵的准确匹配率降低了2.2个百分点;错误分析揭示了对所呈现的A-B-C顺序的系统性复制。单一动作的结果表明,推断动作家族比定位更困难:点击F1的准确率为0.96,而拖动为0.76,尽管被识别的拖动通常定位良好。因此,DDB补充了端到端基准,通过填补GUI定位和最终任务成功之间的缺失诊断层,推动桌面CUA的验证、可靠性和恢复的针对性改进。
博主点评: DDB的引入为评估桌面计算机使用模型提供了新的视角,尤其是在处理复杂的GUI环境时,其多维度的评估标准有助于更准确地识别模型的局限性和潜在改进方向。此项研究为未来的桌面代理智能化发展奠定了重要基础。