论文
面向网页智能体的判别式世界模型
Discriminative World Models for Web Agents
摘要
最近的 Web 代理使用世界模型进行测试时操作选择,方法是对候选操作进行采样、预测生成的 Web 状态,并使用排名模型或过程奖励模型 (PRM) 对它们进行排名。这些世界模型通常通过有监督的下一状态预测进行训练,以生成固定的表示形式,例如 HTML 或 AXTree 快照。然而,这个目标与下游排名器不一致,下游排名器依赖于对候选者进行区分的预测状态来准确地对它们进行评分。为了解决这个问题,我们引入了预测状态匹配,这是一个训练目标,其中预测表示必须区分真实的结果状态和替代动作所达到的状态。我们使用源自 WebArena Go-Browse 轨迹的分支网络代理数据集来训练这些模型,其中每个决策点都包含多个替代操作及其结果状态。对我们保留的预测状态匹配基准的实验表明,我们的方法优于经过监督的下一状态预测训练的世界模型。我们进一步表明,与仅采取行动的 PRM 和使用受监督的下一状态世界模型增强的 PRM 相比,我们的方法提高了 WebPRMBench 上 PRM 式行动的排名。最后,在 WebArena-Lite 上,使用我们的世界模型进行测试时操作选择可以提高端到端任务的成功率。我们的项目页面位于:https://dhruvpendharkar.github.io/dwm/。
