论文

MIRAGE:具有隐式推理与生成式世界模型的移动智能体

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

模型训练监督微调与指令调优

摘要

人们越来越期望移动代理能够通过屏幕截图和语言目标来操作日常应用程序,其中可靠的控制需要对屏幕可供性、多步导航和未来状态变化进行推理。然而,许多代理将这种计算具体化为长文本思想链,这减慢了交互,增加了监督成本并使部署复杂化。我们引入了 MIRAGE,一个从可见文本推理痕迹中学习连续潜在推理表示的框架。 MIRAGE 将显式推理转换为紧凑的隐藏状态,使代理能够在内部进行推理,而无需解码长的基本原理。它还包含一个生成世界模型目标:潜在推理向量与未来的屏幕截图保持一致,鼓励代理在行动之前预测即将到来的界面状态。这将隐藏计算转变为压缩的思维表征和环境动态的前瞻性模型。在推理时,MIRAGE 在连续潜在空间中进行推理,减少 token 生成,同时提高执行效率。在 AndroidWorld 上,MIRAGE 在 4B 消融中匹配了明确的思想链监督微调,解码令牌预算降低了 3-5 倍,并将可比较的指令调整基线提高了 10.2 个点;在 AndroidControl 上,它改进了操作基础,同时生成的令牌减少了 75% 以上。

MIRAGE:具有隐式推理与生成式世界模型的移动智能体:论文配图
图 1:随机采样任务和 MIRAGE 工作流程的推理时间比较:基线发出详细的可见痕迹,而 MIRAGE 使用潜在标记进行推理并公开简洁的操作。