论文

Proactive Agent Research Environment:模拟主动用户以评估主动式助手

Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants

智能体系统Agent任务评测

摘要

能够预判用户需求并自主执行任务的主动式(proactive)智能体作为数字助手前景广阔,但缺乏逼真的用户模拟框架阻碍了其发展。现有方法将应用建模为扁平的工具调用API,无法捕捉数字环境中用户交互的有状态与顺序性本质,使逼真的用户模拟无从实现。我们提出主动式智能体研究环境(Pare),一个用于在数字环境中构建与评估主动式智能体的框架。Pare将应用建模为有限状态机,为用户模拟器提供有状态导航与依赖状态的动作空间,从而实现主动的用户模拟。在此基础上,我们提出Pare-Bench,一个包含143个多样任务的基准,覆盖通信、效率、日程与生活方式类应用,旨在测试情境观察、目标推断、干预时机与多应用编排。

Proactive Agent Research Environment:模拟主动用户以评估主动式助手:论文配图
图 1:Pare 框架架构概述。 Pare 框架由一个基于事件的环境组成,该环境对有状态应用程序转换进行建模。用户环境界面根据当前活动应用程序的当前状态 StS_{t} 公开选择性工具,并且用户操作会导致应用程序状态转换。而代理环境接口将所有工具公开为平面 API 结构,以便主动助理能够高效地收集信息和执行任务。