论文

LiteGUI:经强化学习蒸馏紧凑GUI智能体

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

模型优化模型训练强化学习蒸馏RLVRAgentic RL

摘要

开发轻量级设备上视觉语言 GUI 代理对于高效的跨平台自动化交互至关重要。然而,当前的设备上代理受到模型容量有限的限制,仍然迫切需要进一步改进性能。传统的小规模模型监督微调(SFT)往往会导致过度拟合、灾难性遗忘和政策僵化,因此无法完全应对这些挑战。在这项工作中,我们提出了一种新颖的无 SFT 训练范式,可以显着增强小规模模型的性能。我们首先提出通过引导式策略蒸馏将广义知识蒸馏初步系统地集成到 GUI 代理域中。通过将预言机参考轨迹与动态检索机制结合起来,我们的方法减少了幻觉并减轻了多解决方案 GUI 任务中固有的认知失调。在此基础上,我们进一步引入了多解决方案双级 GRPO 框架,该框架将宏观级子任务规划与微观级执行匹配联合起来,从而改善长视野 GUI 代理场景的探索。此外,我们构建了一个自动数据生成管道来合成具有丰富的多解决方案注释的 GUI 任务轨迹。大量的实验表明,我们的方法在轻量级模型中实现了最先进的性能,同时在所有基准测试中与更大规模的模型保持竞争力。消融研究进一步表明,结构化的策略蒸馏和多解决方案双层探索可以充分释放 2B/3B 规模智能体的能力,超越传统模仿学习的性能限制。

LiteGUI:经强化学习蒸馏紧凑GUI智能体:论文配图
图 1:Lite-GUI 概述。该框架包括: (a) 自动 GUI 轨迹生成模块,用于生成 GUI 任务的动作轨迹; (b) 用于生成训练数据的 OPD 和 RL 数据构建模块,特别关注 OPD 和 RL 的多解决方案注释; (c) 拟议的两阶段训练范例,包括引导按策略蒸馏和多解决方案双层 GRPO。框架的详细内容可参见附录A.7。