论文

CLIFT:用于 Web 智能体、训练和测试时缩放的共形自验证

CLIFT: Conformal Self-Verification for Web Agent Training and Test-Time Scaling

模型推理推理验证与自校正

摘要

开源网络智能体现在已经足够强大,可以执行现实的浏览器任务,但是带有强化学习的训练仍然依赖于弱监督:二进制任务成功率对于信用分配来说太稀疏,而前沿语言模型法官在每一步调用都太昂贵,并且不能假设在部署时可用。我们引入 CLIFT,这是一种围绕共形自验证构建的训练和测试时缩放方法。在训练期间,智能体回答有关其自身执行轨迹的自然语言验证问题;组合适形验证者仅保留其 URL 条件证据与训练时间判断一致的问题信号,通过极性感知提升分配签名信任权重,并将所得验证者分数以永远不会从判断基线中减去的方式混合到每步奖励中。在测试时,同一个经过认证的银行被冻结并重新用作保形轨迹选择(CTS)的结构化证据:智能体对贪婪的执行轨迹进行采样并进行一次或多次不同的重试,自验证器总结每个 URL 跟踪,并且保守的多数投票规则选择是否从当前的现任银行中交换出来,而无需调用任何外部法官。这个单一机制支持三种设置。在 WebArena Infinity 上,CLIFT 在开源 Web 智能体中实现了最先进的性能。在 VisualWebArena 上,接受过开放模型训练的银行在测试时转移到 GPT-5.5,并在规范的Harness下达到了最先进的性能。在 Online Mind2Web 上,基准上没有训练和智能体,翻译认证题库可以提高实时网络智能体的零样本评估。这些结果将共形自验证定位为将昂贵的判断反馈转变为可重复使用的训练信号和无判断的测试时缩放信号的一种方法。