论文
A11y并非盟友:Android无障碍特性如何让移动AI智能体暴露于间接提示词注入
Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection
摘要
自主AI智能体的兴起代表着用户与移动设备交互方式的重大范式转变。MobileRun与Mobile-Use等框架能够自主操作Android应用并执行复杂的多步任务。为解读用户界面,这些框架主要依赖Android无障碍(A11y)树,其次依赖视觉截图。本文证明,这种对未经消毒的无障碍元数据(连同视觉输入)的架构性依赖,引入了间接提示词注入的系统性漏洞。我们表明,对抗性提示词可导致自主智能体放弃原有目标、违反上下文边界并执行未经授权的设备操作。实证评估在视觉隐藏与完全暴露两类攻击场景中均展示了目标劫持、上下文漂移与未授权操作。总体而言,MobileRun配合Gemma4:31B达到0.822的攻击成功率;Mobile-Use配合Qwen3.6:35B将其降至0.150,但并未消除上下文漂移或未授权操作。这些发现揭示,当前移动智能体框架未能实施语义上下文边界,把被动的环境文本当作可信指令。最后,我们给出此类攻击的分类法,并讨论在移动智能体架构中实施零信任输入校验、专用安全智能体与严格上下文隔离的必要性。
