论文
Proactive Agent Research Environment:模拟主动用户以评估主动式助手
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
摘要
能够预判用户需求并自主执行任务的主动式(proactive)智能体作为数字助手前景广阔,但缺乏逼真的用户模拟框架阻碍了其发展。现有方法将应用建模为扁平的工具调用API,无法捕捉数字环境中用户交互的有状态与顺序性本质,使逼真的用户模拟无从实现。我们提出主动式智能体研究环境(Pare),一个用于在数字环境中构建与评估主动式智能体的框架。Pare将应用建模为有限状态机,为用户模拟器提供有状态导航与依赖状态的动作空间,从而实现主动的用户模拟。在此基础上,我们提出Pare-Bench,一个包含143个多样任务的基准,覆盖通信、效率、日程与生活方式类应用,旨在测试情境观察、目标推断、干预时机与多应用编排。
