论文

IntentCUA:为计算机使用智能体的技能抽象与多智能体规划学习意图级表征

IntentCUA: Learning Intent-level Representations for Skill Abstraction and Multi-Agent Planning in Computer-Use Agents

智能体系统模型训练上下文与知识强化学习记忆Agent 协作Agent SkillsAgentic RLAgent记忆

摘要

计算机使用智能体在噪声感知、多窗口上下文和演化的环境状态下进行长视界运作。从基于 RL 的规划器到轨迹检索,现有方法常偏离用户意图并重复求解常规子问题,导致误差累积和低效。我们提出 IntentCUA,一个多智能体计算机使用框架,通过意图对齐的计划记忆稳定长视界执行。规划器、计划优化器与批评者在共享记忆上协作,把原始交互踪迹抽象为多视角意图表征和可复用技能。运行时,意图原型检索与子组对齐的技能并注入部分计划,减少冗余重规划并缓解跨桌面应用的误差传播。在端到端评估中,IntentCUA 取得 74.83% 任务成功率和 0.91 的步骤效率比,优于基于 RL 和以轨迹为中心的基线。消融显示,多视角意图抽象与共享计划记忆共同提升执行稳定性,协作多智能体回路在长视界任务上带来最大收益。这些结果凸显,系统级意图抽象和基于记忆的协作是大型动态环境中可靠高效桌面自动化的关键。

IntentCUA:为计算机使用智能体的技能抽象与多智能体规划学习意图级表征
图1:IntentCUA概览。离线:原始用户轨迹经多视角标注,嵌入到共享意图空间,并聚类为意图组(IG)与子组(SG);SG动作模式被转换为参数化技能模式(“技能提示”/skill hints),连同其SG一起存入IG/SG索引,而计划记忆仅存储用户批准的全局计划(G)。在线:Planner/Plan-Optimizer/Critic查询并复用技能;缓存优先的复用与基于模板的缺口填补减少了长时程桌面任务上的重新规划。