论文

通过视觉状态转移扩展GUI智能体

Scaling GUI Agents with Visual State Transitions

模型训练预训练

摘要

我们提出状态转移预训练(State Transition Pretraining, STP),作为GUI智能体的一个新扩展轴。在STP阶段,我们在视觉状态转移上持续预训练一个统一多模态模型,联合优化逆动力学(从状态变化预测动作)与正动力学(从当前状态和动作预测下一状态)。这一优化使模型具备更好的动作锚定的视觉表示,以及关于GUI动力学的内部世界模型。随后在带任务指令的轨迹上微调后,经STP训练的模型在桌面与移动GUI场景的智能体基准(AgentNetBench、AndroidControl和GUIOdyssey)上持续优于仅通过直接轨迹微调训练的基线。进一步的实证研究表明,联合动力学优化相比单目标训练带来稳定提升,且下游性能随转移数据量稳步扩展。

通过视觉状态转移扩展GUI智能体:论文配图
图 3:STP 中逆向和正向动态的图示。前向动力学通过在给定当前状态和动作的情况下预测下一个状态来对转换 (st,at)→st+1(s_{t},a_{t})\rightarrow s_{t+1} 进行建模。逆动力学模型 (st,st+1)→at(s_{t},s_{t+1})\rightarrow a_{t} 通过推断引起转变的动作。