论文
IntentCUA:为计算机使用智能体的技能抽象与多智能体规划学习意图级表征
IntentCUA: Learning Intent-level Representations for Skill Abstraction and Multi-Agent Planning in Computer-Use Agents
摘要
计算机使用智能体在噪声感知、多窗口上下文和演化的环境状态下进行长视界运作。从基于 RL 的规划器到轨迹检索,现有方法常偏离用户意图并重复求解常规子问题,导致误差累积和低效。我们提出 IntentCUA,一个多智能体计算机使用框架,通过意图对齐的计划记忆稳定长视界执行。规划器、计划优化器与批评者在共享记忆上协作,把原始交互踪迹抽象为多视角意图表征和可复用技能。运行时,意图原型检索与子组对齐的技能并注入部分计划,减少冗余重规划并缓解跨桌面应用的误差传播。在端到端评估中,IntentCUA 取得 74.83% 任务成功率和 0.91 的步骤效率比,优于基于 RL 和以轨迹为中心的基线。消融显示,多视角意图抽象与共享计划记忆共同提升执行稳定性,协作多智能体回路在长视界任务上带来最大收益。这些结果凸显,系统级意图抽象和基于记忆的协作是大型动态环境中可靠高效桌面自动化的关键。
