论文

基于Agentic-Q估计与逐步策略优化构建自主GUI导航

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

模型训练强化学习Agentic RL

摘要

多模态大语言模型(MLLM)的近期进展极大推动了图形用户界面(GUI)自主智能体的发展。然而在实际应用中,GUI智能体常常面临非平稳环境,导致数据整理与策略优化的计算成本高昂。本报告提出一个以MLLM为中心的新型GUI智能体框架,由两个组件构成:agentic-Q估计与逐步策略优化。前者旨在优化一个Q模型,该模型能生成逐步价值以评估给定动作对任务完成的贡献。后者以取自状态-动作轨迹的逐步样本为输入,使用我们的agentic-Q模型通过强化学习优化策略。需要注意的是:(i) 所有状态-动作轨迹均由策略自身产生,因此数据收集成本可控;(ii) 策略更新与环境解耦,确保稳定而高效的优化。实证评估显示,该框架赋予Ovis2.5-9B强大的GUI交互能力,在GUI导航与定位(grounding)基准上取得显著表现,甚至超过规模更大的竞争者。

基于Agentic-Q估计与逐步策略优化构建自主GUI导航
图2:我们框架的三个阶段示意图:(i) Ovis2.5_SFT 在 grounding 数据和一组专家网页导航轨迹上训练;(ii) 我们收集由 Ovis2.5_SFT 自身产生的状态-动作轨迹,并以二分类方式训练我们的 agentic-Q 模型;(iii) 在 agentic-Q 模型的引导下,我们使用自生成的分步轨迹优化策略。