论文

从离策略到在策略:以双层专家-策略同化增强GUI Agent

From Off-Policy to On-Policy: Enhancing GUI Agents via Bi-level Expert-to-Policy Assimilation

模型训练强化学习RLVRAgentic RL

摘要

视觉语言模型正越来越多地被部署为操作桌面和浏览器的计算机使用智能体(CUA)。表现最佳的CUA是基于框架的系统,会把规划与执行分解;而端到端的截图到动作策略更易部署,但在OSWorld-Verified等基准上落后。OSWorld等GUI数据集存在两个瓶颈:它们仅提供数百个可交互、可验证的任务和环境,而且专家轨迹必须通过与这些环境交互来收集,使得此类数据难以规模化。因此我们要问:基于可验证奖励的强化学习(RLVR)如何才能最好地利用小规模现有专家轨迹来训练端到端策略。将这些离策略轨迹直接混入在策略RLVR是脆弱的:即使经过格式转换,专家轨迹仍与学习者存在结构失配和分布偏移。我们提出BEPA(Bi-Level Expert-to-Policy Assimilation,双层专家-策略同化),它通过在基础策略下自生成的可达轨迹(LEVEL-1)以及RLVR中使用的按任务动态更新缓存(LEVEL-2),把静态专家轨迹转化为与策略对齐的指导。在OSWorld-Verified上,BEPA将UITARS1.5-7B的成功率从22.87%提升至32.13%,并把一个留出划分从5.74%提升至10.30%,在MMBench-GUI和Online-Mind2Web上也有一致的增益。我们的代码和数据见:https://github.com/LEON-gittech/Verl_GUI.git

从离策略到在策略:以双层专家-策略同化增强GUI Agent 配图
图 1:BEPA 概览。我们通过两个模块化、即插即用的阶段来利用强大但与策略不匹配的专家。LEVEL-1 通过在基础策略下重新采样专家计划,初始化一个与策略兼容的引导种子。LEVEL-2 利用智能体自身涌现的成功案例维护一个自对齐的逐任务缓存,使离策略(off-policy)引导相对不断演化的在策略流形(on-policy manifold)保持在可控的分布差距内。缓存的引导仅在在策略完全失败时(即一组内所有 rollout 都失败时)才注入 GRPO。