论文
屏幕上的图灵测试:移动GUI智能体拟人化基准
Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization
摘要
自主GUI智能体的崛起引发了数字平台的对抗性反制措施,但现有研究优先考虑效用与稳健性,忽视了反检测这一关键维度。我们主张,智能体要在以人为中心的生态系统中存续,必须演化出拟人化(Humanization)能力。我们提出“屏幕上的图灵测试”,把该交互形式化为检测器与旨在最小化行为差异的智能体之间的MinMax优化问题。随后,我们收集了一个新的高保真移动触控动态数据集,并展开分析:原生LMM智能体因不自然的运动学特征而易于被检测。据此,我们建立智能体拟人化基准(AHB)和检测指标,以量化可模仿性与效用之间的权衡。最后,我们提出从启发式噪声到数据驱动行为匹配的多种方法,证明智能体在理论上和实践中都能在不牺牲性能的情况下实现高可模仿性。这项工作把范式从智能体能否执行任务转向它在以人为中心的生态系统中如何执行任务,为在对抗性数字环境中的无缝共存奠定基础。
