论文

多智能体会梦见电子屏幕吗?通过任务分解在AndroidWorld上达到完美准确率

Do Multi-Agents Dream of Electric Screens? Achieving Perfect Accuracy on AndroidWorld Through Task Decomposition

智能体系统Agent 协作

摘要

我们提出Minitap,一个在AndroidWorld基准上取得100%成功率的多智能体系统,是首个完整解决全部116个任务的系统,并超越了人类表现(80%)。我们首先分析单智能体架构为何失败:混合推理轨迹造成的上下文污染、未被智能体察觉的静默文本输入失败,以及无法逃脱的重复动作循环。Minitap通过针对性机制逐一应对这些失败:六个专用智能体之间的认知分离、对照设备状态对文本输入进行的确定性后验校验,以及检测循环并触发策略切换的元认知推理。消融实验显示,多智能体分解比单智能体基线贡献+21分;经验证的执行增加+7分;元认知增加+9分。我们以开源软件形式发布Minitap。https://github.com/minitap-ai/mobile-use

多智能体会梦见电子屏幕吗?通过任务分解在AndroidWorld上达到完美准确率
图1:Minitap 使用六个专职智能体,并以 Cortex 作为中央推理瓶颈。该系统将移动自动化分解为两个阶段:(1) Plan(规划),Planner 将用户目标分解为有序子目标,Orchestrator 跟踪其完成状态;(2) Act(行动),Contextor 捕获设备状态,Cortex 对状态进行推理以选择动作,Executor 验证命令并将其分发给与平台无关的 Device Controller。Summarizer 压缩动作历史以管理上下文长度。Convergence 节点负责控制流路由:继续下一轮迭代、在子目标失败时触发重新规划,或在任务完成时终止。图标表示模型能力要求:大脑图标表示高容量推理模型;闪电图标表示可蒸馏、可采用更小更快模型的组件。