论文

StepGuard:经单步校准守护网页导航

StepGuard: Guarding Web Navigation via Single-Step Calibration

智能体系统Agent 环境交互

摘要

网页导航要求智能体遵循自然语言目标、与网页交互并产出准确答案。虽然近期进展利用视觉语言模型与强化学习——既有方法仍因奖励错位与错误传播而 suffer 单步脆弱性。为解决奖励纠缠——我们设计动态双策略优化(DDPO)——在导航优先(探索)与答案优先(问答)两种模式间动态切换以缓解奖励冲突。为校准单步错误——我们提出置信引导的自适应导航反思(CANR)——估计逐步置信度、仅在必要时触发反思——并用对比奖励鼓励自我纠正以校准单步误差。以上述为主要组件——我们最终开发StepGuard——经单步校准守护网页导航的新框架。实验表明我们的方法显著改进导航与答案准确率——在标准网页导航基准上创下新SOTA。

StepGuard:经单步校准守护网页导航:论文配图
图 1:拟议的 StepGuard 概述。与由于纠缠导航和应答目标而失败的静态基线 (b) 不同,StepGuard (a) 通过 DDPO 动态解耦这些任务并通过 CANR 纠正决策,从而实现精确的状态自适应执行,从而实现稳健的性能。