论文

CaptchaMind:通过强化学习和显式推理监督训练验证码求解器

CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision

模型训练强化学习

摘要

验证码作为人工验证机制被广泛部署,并经常阻止智能代理在现实世界的 Web 环境中完成端到端自动化。解决现代验证码需要强大的多步骤视觉推理和交互能力,但由于缺乏大规模训练数据和流程级注释,基于训练的方法仍然不存在。我们推出了 CaptchaBench,这是第一个旨在支持大规模训练的 CAPTCHA 基准测试,包含跨八个任务类别的 16,000 个以编程方式生成的样本,并带有详细的区域和进程级注释。 CaptchaBench 的系统评估表明,现有方法在需要细粒度视觉细节捕获和区域级比较的任务上始终失败。因此,我们推出了 CaptchaMind,这是一种基于强化学习的求解器,经过明确的推理过程监督训练,在八个任务中实现了 82.9% 的平均成功率,在现实世界实例中实现了 71.0% 的平均成功率,大大优于所有没有闭源 API 的现有方法。