论文
超越成功与失败:面向GUI智能体的长度感知对比学习
Beyond Success and Failure: Length-Aware Contrastive Learning for GUI Agents
摘要
由多模态大语言模型(MLLM)驱动的图形用户界面(GUI)智能体在自动化跨多样数字环境的任务方面展现出强大潜力,其中强化学习(RL)已成为主流训练范式。然而,GRPO(组相对策略优化)等广泛使用的方法存在奖励-梯度错位问题,导致优化低效且不稳定。近期工作通过将可验证奖励的强化学习(RLVR)重构为对比式或分类式目标来应对这一问题,通过消除有问题的梯度行为来提升稳定性。尽管有此进展,现有的对比式RLVR方法主要依赖结果层面的监督,无法捕捉同一结果类别内轨迹质量的细粒度差异。本文提出LACL-GUI(面向GUI智能体的长度感知对比学习),一个将轨迹级质量信号纳入策略优化的对比式RLVR框架。LACL-GUI在成功轨迹与失败轨迹内部均引入结构化偏好,鼓励简洁的成功执行,并依据与成功轨迹的偏离度区分失败质量,同时保持优化稳定性。在GUI智能体基准上的实验表明,LACL-GUI提供了更有效的学习信号,并在先前方法基础上持续提升智能体性能,凸显了对比式RLVR中轨迹级监督的价值。
