论文
基于Agentic-Q估计与逐步策略优化构建自主GUI导航
Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization
摘要
多模态大语言模型(MLLM)的近期进展极大推动了图形用户界面(GUI)自主智能体的发展。然而在实际应用中,GUI智能体常常面临非平稳环境,导致数据整理与策略优化的计算成本高昂。本报告提出一个以MLLM为中心的新型GUI智能体框架,由两个组件构成:agentic-Q估计与逐步策略优化。前者旨在优化一个Q模型,该模型能生成逐步价值以评估给定动作对任务完成的贡献。后者以取自状态-动作轨迹的逐步样本为输入,使用我们的agentic-Q模型通过强化学习优化策略。需要注意的是:(i) 所有状态-动作轨迹均由策略自身产生,因此数据收集成本可控;(ii) 策略更新与环境解耦,确保稳定而高效的优化。实证评估显示,该框架赋予Ovis2.5-9B强大的GUI交互能力,在GUI导航与定位(grounding)基准上取得显著表现,甚至超过规模更大的竞争者。
