NeFut Logo NeFut
EN 管理员登录

[AI学术] ElderBench:面向老年人的移动自主代理基准

发布于:2026-09-07 22:00 最后更新:2026-09-08 00:37
#algorithm #AI #Machine Learning

随着移动自主代理在帮助老年人使用智能手机方面展现出巨大潜力,现有的 GUI 基准大多依赖明确的目标指令,难以覆盖老年用户常见的间接表达、指代模糊和请求不完整等语言特征。这种基准与真实交互之间的差距可能阻碍代理的可靠部署。

为弥补这一缺口,我们推出 ElderBench——首个面向老年人真实使用场景的移动 GUI 代理评估基准。基准收集了来自 20 款常用应用的 249 条自然 elicited 的手机任务,全部由老年用户自行描述。

我们从句法、语义和语用三个层面系统分析了老年指令与现有 GUI 基准指令的语言差异,发现老年指令更倾向于使用省略、指代不明和情境依赖的表达方式。

随后,在在线和离线两种设置下,对主流 GUI 代理和视觉语言模型(VLM)进行评测,结果显示在处理老年指令时性能出现显著下降。

进一步通过指令规范化、失败案例剖析以及细粒度语言特征关联分析,确认了老年特有的语言模式是导致错误的主要因素。

基于上述发现,我们提出了若干设计建议,包括增强模型对省略和指代的解析能力、引入可解释的交互反馈以及在训练数据中加入老年人语言的多样性,以推动更具适应性和包容性的 GUI 代理。

点评

原文链接: https://arxiv.org/abs/2609.04850

[h] 返回首页