论文
训练需要可信的世界:用于智能体学习的经验证合成Web环境
Training Needs Trustworthy Worlds: Verified Synthetic Web Environments for Agent Learning
摘要
Web智能体有望自动化复杂的数字工作流,但其训练受限于那些看起来合理、却暗藏失效链接、不一致状态或不可行任务的合成环境。我们通过构建可执行、可审计、扎根于后端状态的合成Web环境,来弥合可扩展环境生成与可信智能体学习之间的鸿沟。我们的框架将每个生成的网站表示为页面、导航链接、数据库记录、状态变更标记和任务约束的结构化脚手架,然后在策略训练之前验证并修复结构、语义、一致性和可行性缺陷。在交互过程中,普通UI转换以确定性方式执行,而持久的后端更新只能通过经验证的状态变更标记调用,从而支持由经验证的任务进展谓词编译出的密集奖励。在跨越六个域的500个合成环境中,我们的方法减少了阻碍任务的缺陷,将可行任务率从48.6%提升到94.8%,同时产生更强的PPO策略,并在评估时不调用LLM的情况下提升向WebArena、WebShop和MiniWoB++的迁移。这些结果表明,经验证的合成环境可以作为紧凑Web智能体的可扩展且可靠的训练基底,将合成Web智能体学习从表面合理性转向可执行、扎根于状态的监督。
