论文

Unified Agent:管理跨设备交互

Unified Agent: Managing Interactions across Devices

智能体系统上下文与知识记忆Agent 架构与控制循环Agent记忆

摘要

随着能力的迅速增加,AI代理可以在时间上从一个应用扩展到用户的设备。然而,现有的代理系统在这个场景中仍然不足。这是因为观察分散在不同的设备和时刻,但主流系统并没有为此设计:单个代理将设备视为工具,缺乏所有设备和时间内的有效状态管理,而多代理系统则跨代理协调,但没有维护跨设备、跨时间的紧凑携带状态的需求。我们认为代理应该保持一个有效地设计的状态,组织参与证据、陈述事实和当前观察下的行动请求,在决定其行动时。为了比较状态设计,我们构建了一个跨设备和时间的用户-代理交互基准。我们将这一原则应用于Unified Agent,这是一个携带互动证据并使用当前观察进行行动的有状态代理。在默认设置下,它显著优于我们的四种现有设计的改编版本。随着多模态大语言模型(MLLM)家族的变化、能力增强和推理努力,它仍然领先于所有比较系统,表明状态设计优势在MLLM设置中是稳健的。我们将代码和数据公开在GitHub上。

Unified Agent:管理跨设备交互:论文配图
图 1:一名代理在一段时间内跨设备为一名用户提供服务。在比较了多个设备上的餐厅后,用户后来决定进行预订,但忘记了餐厅的名称。因此,用户在不指定设备的情况下要求预订“我一直在看的餐厅”。无状态代理可能需要询问:“它在哪个设备上?”相比之下,统一代理具有紧凑、行动就绪的状态,并解析了对电话上餐厅的引用,其中用户的参与度最强。更好的状态设计使请求变得可响应。