论文

ElderBench:面向老年人的自主移动智能体基准

ElderBench: Benchmarking Autonomous Mobile Agents for Older Adults

智能体系统Agent任务评测

摘要

虽然自主移动智能体在帮助老年人使用智能手机方面具有巨大潜力,但现有的 GUI 基准主要依赖于明确的、面向目标的指令,很少捕获老年用户自然发生的语言模式,例如间接言语、指称模糊和未指定的请求。基准指令与现实世界的老年人交互之间的不匹配可能会阻碍可靠的智能体部署。为了弥补这一差距,我们推出了 ElderBench,这是第一个在真实的面向老年人的场景中评估移动 GUI 智能体的基准。 ElderBench 由 20 个应用程序中从老年人那里收集的 249 项自然引发的智能手机任务构建而成。我们首先从句法、语义和语用的角度描述了老年人指令和现有 GUI 基准指令之间的语言差异。然后,我们在在线和离线设置下评估主流 GUI 智能体和视觉语言模型,发现在处理面向老年人的指令时性能大幅下降。通过受控指令规范化、失败分析和细粒度语言特征分析,我们进一步确定了老年人特定的语言模式如何导致智能体失败。我们的研究结果为老年人提供了更具适应性、可解释性和年龄包容性的 GUI 智能体的可行设计见解。

ElderBench:面向老年人的自主移动智能体基准:论文配图
图 1:ElderBench 基准框架概述。该架构具有双模块评估模式,支持在线和离线评估模式,可以在老年GUI指令下系统地评估自主移动智能体。