论文
通过视觉状态转移扩展GUI智能体
Scaling GUI Agents with Visual State Transitions
摘要
我们提出状态转移预训练(State Transition Pretraining, STP),作为GUI智能体的一个新扩展轴。在STP阶段,我们在视觉状态转移上持续预训练一个统一多模态模型,联合优化逆动力学(从状态变化预测动作)与正动力学(从当前状态和动作预测下一状态)。这一优化使模型具备更好的动作锚定的视觉表示,以及关于GUI动力学的内部世界模型。随后在带任务指令的轨迹上微调后,经STP训练的模型在桌面与移动GUI场景的智能体基准(AgentNetBench、AndroidControl和GUIOdyssey)上持续优于仅通过直接轨迹微调训练的基线。进一步的实证研究表明,联合动力学优化相比单目标训练带来稳定提升,且下游性能随转移数据量稳步扩展。
