论文
UI-Copilot:通过工具集成策略优化推进长期 GUI 自动化
UI-Copilot: Advancing Long-Horizon GUI Automation via Tool-Integrated Policy Optimization
摘要
基于MLLM的GUI智能体在复杂的用户界面交互任务中表现出了强大的能力。然而,长期场景仍然具有挑战性,因为这些代理承担着超出其固有能力的任务,遭受记忆退化、进度混乱和数学幻觉的困扰。为了应对这些挑战,我们提出了 UI-Copilot,这是一个协作框架,其中 GUI智能体 专注于任务执行,而轻量级副驾驶则为内存检索和数值计算提供按需帮助。我们引入内存解耦来将持久观察与瞬态执行上下文分开,并训练策略代理根据任务需求有选择地调用副驾驶作为 检索器 或计算器。为了实现有效的工具调用学习,我们提出了工具集成策略优化(TIPO),它通过单轮预测和 同策略多轮轨迹采样分别优化工具选择和任务执行。实验结果表明,UI-Copilot-7B 在具有挑战性的 MemGUI-Bench 上实现了最先进的性能,优于强大的 7B 规模 GUI智能体,例如 GUI-Owl-7B 和 UI-TARS-1.5-7B。此外,与基本 Qwen 模型相比,UI-Copilot-7B 在 AndroidWorld 上的绝对改进为 17.1%,凸显了 UI-Copilot 对现实世界 GUI 任务的强大泛化能力。