论文

何时教、教什么:Web Agent的预算感知在线适配

When and What to Teach: Budget-Aware Online Adaptation for Web Agents

模型训练持续学习

摘要

Web 智能体在自动化复杂的互联网任务方面取得了巨大的成功,但将它们部署到现实环境中需要持续的在线适应。鉴于部署强大的专有模型在商业上成本仍然高昂,从业者必须依赖轻量级本地模型,这些模型在部署后通过更强大的教师的在线教学进行演变。然而,标准的交互式反馈会带来高昂的成本。我们表明,传统的轨迹级偏好优化在无法解决的事件和冗余执行轮次上浪费了预算。为了解决这些低效率问题,我们提出了 带有预算轨迹修剪的分数引导在线教学,这是一个预算感知框架,可以系统地协调 何时 和 教学内容。具体来说,我们的框架集成了一个可解性感知的教师门来指示 when 来查询教师模型,并集成了一个分数引导的回合选择机制来决定 what 信息回合要保留。 MiniWoB 和 TimeWarp 上的大量实验表明,我们的方法取得了相当的首次成功,同时平均减少了 22.6% 的教师调用和 52.1% 的学生训练计算。我们的代码可在此 https URL 获取。

何时教、教什么:Web Agent的预算感知在线适配:论文配图
图 1:带有预算轨迹调整的分数引导在线教学概述。该框架首先利用可解决性感知的教师门来决定学生的失败是否需要教师查询。然后,在执行轨迹级偏好优化更新之前,它应用分数引导的转弯选择机制,使用学生对数概率来修剪生成的匹配轨迹对。