论文
StepGuard:经单步校准守护网页导航
StepGuard: Guarding Web Navigation via Single-Step Calibration
摘要
网页导航要求智能体遵循自然语言目标、与网页交互并产出准确答案。虽然近期进展利用视觉语言模型与强化学习——既有方法仍因奖励错位与错误传播而 suffer 单步脆弱性。为解决奖励纠缠——我们设计动态双策略优化(DDPO)——在导航优先(探索)与答案优先(问答)两种模式间动态切换以缓解奖励冲突。为校准单步错误——我们提出置信引导的自适应导航反思(CANR)——估计逐步置信度、仅在必要时触发反思——并用对比奖励鼓励自我纠正以校准单步误差。以上述为主要组件——我们最终开发StepGuard——经单步校准守护网页导航的新框架。实验表明我们的方法显著改进导航与答案准确率——在标准网页导航基准上创下新SOTA。
