论文
从离策略到在策略:以双层专家-策略同化增强GUI Agent
From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation
摘要
视觉语言模型正越来越多地被部署为操作桌面和浏览器的计算机使用智能体(CUA)。表现最佳的CUA是基于框架的系统,会把规划与执行分解;而端到端的截图到动作策略更易部署,但在OSWorld-Verified等基准上落后。OSWorld等GUI数据集存在两个瓶颈:它们仅提供数百个可交互、可验证的任务和环境,而且专家轨迹必须通过与这些环境交互来收集,使得此类数据难以规模化。因此我们要问:基于可验证奖励的强化学习(RLVR)如何才能最好地利用小规模现有专家轨迹来训练端到端策略。将这些离策略轨迹直接混入在策略RLVR是脆弱的:即使经过格式转换,专家轨迹仍与学习者存在结构失配和分布偏移。我们提出BEPA(Bi-Level Expert-to-Policy Assimilation,双层专家-策略同化),它通过在基础策略下自生成的可达轨迹(LEVEL-1)以及RLVR中使用的按任务动态更新缓存(LEVEL-2),把静态专家轨迹转化为与策略对齐的指导。在OSWorld-Verified上,BEPA将UITARS1.5-7B的成功率从22.87%提升至32.13%,并把一个留出划分从5.74%提升至10.30%,在MMBench-GUI和Online-Mind2Web上也有一致的增益。我们的代码和数据见:https://github.com/LEON-gittech/Verl_GUI.git
