论文

Mobile-Aptus:基于 MLLM 的移动使用代理中信心驱动的主动且稳健的交互

Mobile-Aptus: Confidence-Driven Proactive and Robust Interaction in MLLM-based Mobile-Using Agents

智能体系统Agent 动作执行与治理

摘要

多模式 大语言模型 (MLLM) 的最新进展在使移动使用代理能够自主执行人类指令方面显示出巨大的潜力。然而,完全自动化的代理经常在无法解决任务的情况下尝试执行任务,从而导致过度执行的问题。之前的研究通过训练交互式移动代理来解决这个问题,当代理无法完成用户指令时,让代理请求人类交互。然而,我们发现这些交互代理往往表现出过度征求行为,过度依赖人类干预。为了缓解过度执行和过度请求,我们提出了一个通用的置信集成框架,该框架可以在基于 MLLM 的移动使用代理中实现置信驱动的主动且稳健的交互。该框架由交互能力赋能和置信偏差校正两个阶段组成。在交互能力赋能阶段,智能体通过有监督的微调学习来输出动作和置信度分数。在置信偏差校正阶段,代理学习通过将语义相似性检索与直接偏好优化相结合来输出更准确的置信分数。实验结果表明,Mobile-Aptus 在四种流行的移动使用代理基准测试中实现了最先进的性能:OS-Kairos、AITZ、Meta-GUI 和 AndroidControl。 Mobile-Aptus 在离线基准测试中始终优于所有基线,任务成功率平均提高超过 17%。在现实世界的动态实验中,Mobile-Aptus 的任务成功率超出基线 26%,每条指令仅需要 0.64 个干预步骤。代码可在 https://github.com/Wuzheng02/Mobile-Aptus 获取。