论文

PAUSE:统一服务环境中个人AI助手的以用户为中心基准

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

个人AI助手正越来越多地以任务导向、工具增强的智能体形式部署,在统一的服务环境中运行,以支持用户的日常活动。在现实场景中,这类助手必须对持久化的用户状态进行推理,遵守用户特定的配置与权限,并在多个服务之间维持长时程、约束感知的交互。然而,现有基准往往割裂服务上下文,或将用户状态抽象掉,限制了它们在真实服务场景中评估以用户为中心的个人助手行为的能力。我们提出PAUSE,一个在有状态、服务集成的环境中评估个人AI助手的以用户为中心基准。PAUSE要求智能体在异构的用户自有资源之间协调行动,同时在多轮交互中与环境状态及授权约束保持一致,从而捕捉真实助手部署的核心挑战。该基准通过逼真的用户模拟引入显式的用户-智能体交互,使评估超越静态的工具执行。为支持有原则且可复现的评估,PAUSE采用与任务特性对齐的多模式评估框架。开放式服务管理任务采用语义与轨迹级的行为指标评估,而约束密集型任务则可进行确定性的、基于状态的验证。基准结果显示,即使是最先进的专有模型,在需要状态推理与配置感知的场景中也达不到70%的任务完成率,并呈现出一致且可解释的失败模式。最后,我们提出一个以用户为中心的合成流水线,能够可扩展地生成连贯的服务环境、用户配置与可靠标注的任务,支持基准的可扩展性和后续研究。

PAUSE:统一服务环境中个人AI助手的以用户为中心基准:论文配图
图 1. 系统概览。 PAUSE 模拟以用户为中心的个人服务环境,其中个人人工智能助理在用户权限和系统配置下运行。PAUSE 系统架构的高级图表。该图显示了用户与个人人工智能助理交互,该助理在模拟的个人服务环境中运行。