论文

HLL:智能体能跨越人类最后验证线吗?

HLL: Can Agents Cross Humanity's Last Line of Verification?

智能体系统Agent任务评测

摘要

人们越来越期望多模态代理代表用户操作界面,从而提出了一个核心部署问题:在服务故意防止自动化的工作流程中,它们能否真正替代人类?验证码验证使这个问题变得具体。它不仅仅是一个视觉谜题,而且是在帐户创建、内容访问、表单提交和其他受保护的操作之前放置的人工验证边界。我们引入了 \textbf{人类的最后一行验证 (HLL)},这是一个受控基准,它使用交互式验证码验证来评估代理是否可以通过锚定的、类似人类的交互而不是单独的识别来跨越此边界。 HLL 涵盖了各种验证码交互,并使代理面临受控的现实压力源,包括杂乱的网页、更困难的任务变体以及求解过程的跟踪条件验证。我们在闭环 GUI 环境中评估八个前沿多模态代理。结果表明,当前的代理在人类替代边界上仍然很脆弱:不同验证类型的性能差异很大,在实际界面条件下性能会下降,并且当正确答案必须得到有效操作轨迹的支持时,性能会进一步下降。通过揭示定位、动作校准、状态跟踪和流程一致性方面的差距,HLL 提供了一个具体的测试平台,用于测量多模态代理在受保护的现实工作流程中充当人类替代者的程度。我们的代码可在 https://github.com/XinhaoS0101/HLL 获取

HLL:智能体能跨越人类最后验证线吗?:论文配图
图 1:CAPTCHA 作为最终前沿:通过针对自动化代理测试交互式、人类级别的推理来保护 Web 服务。