论文

屏幕上的图灵测试:移动GUI智能体拟人化基准

Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization

智能体系统Agent任务评测

摘要

自主GUI智能体的崛起引发了数字平台的对抗性反制措施,但现有研究优先考虑效用与稳健性,忽视了反检测这一关键维度。我们主张,智能体要在以人为中心的生态系统中存续,必须演化出拟人化(Humanization)能力。我们提出“屏幕上的图灵测试”,把该交互形式化为检测器与旨在最小化行为差异的智能体之间的MinMax优化问题。随后,我们收集了一个新的高保真移动触控动态数据集,并展开分析:原生LMM智能体因不自然的运动学特征而易于被检测。据此,我们建立智能体拟人化基准(AHB)和检测指标,以量化可模仿性与效用之间的权衡。最后,我们提出从启发式噪声到数据驱动行为匹配的多种方法,证明智能体在理论上和实践中都能在不牺牲性能的情况下实现高可模仿性。这项工作把范式从智能体能否执行任务转向它在以人为中心的生态系统中如何执行任务,为在对抗性数字环境中的无缝共存奠定基础。

屏幕上的图灵测试:移动GUI智能体拟人化基准
图1:GUI 智能体与移动平台之间的对抗格局。该图展示三个关键阶段:(1) 主要冲突:对抗性利益促使平台部署登录拦截、广告陷阱等防御手段。(2) 屏幕上的图灵测试:核心检测机制依赖于区分自然的人类轨迹与智能体轨迹。(3) 智能体拟人化:我们提出对抗性拟人化任务,通过提高智能体的可模仿性将原始智能体转变为拟人化智能体,以在保持任务准确性的同时绕过检测。