论文
面向自纠错Web智能体的可证伪承诺规划
Falsifiable Commitment Planning for Self-Correcting Web Agents
摘要
长程Web智能体常在最终失败前就已偏离轨道:即使当前状态、复用的技能或规划假设已不再支持用户指令,轨迹仍可能在局部看似合理。现有智能体会规划、反思或复用经验,但其规划很少指明在何种证据下一个进行中的步骤仍应被信任。我们提出FCPAgent,一个面向鲁棒长程Web智能体的可证伪承诺规划框架。FCPAgent将每个规划步骤表示为一个可证伪承诺单元(Falsifiable Commitment Unit, FCU):一个由可复用技能支撑的子目标,连同证实证据、证伪证据与置信分数。执行被组织为规划—测试—修复循环。混合承诺测试模块在候选动作修改浏览器之前进行检查,并在执行后检查观测;为提高效率,它将轻量证据匹配与基于LLM的诊断验证相结合。当证据证伪一个承诺时,范围感知修复将矛盾定位到执行、技能或规划层级,并只修订最小的充分部分。在WebArena上,FCPAgent的平均成功率相对最强基线取得13.8%的相对提升,在长程任务上收益尤其显著。
