论文

ProEvent:面向主动式智能体的事件中心基准

ProEvent: An Event-centric Benchmark for Proactive Agents

智能体系统Agent任务评测

摘要

主动式智能体被期望通过感知环境上下文、在无显式指令的情况下预判用户需求并提供自主协助。这类智能体的基本能力是识别并跟踪用户即将发生的事件,从而提供持续的、事件特定的协助:例如记录一次计划徒步的时间地点后,提前发送天气提醒或在出发前提供导航支持。然而现有主动智能体工作大多忽视事件中心协助,且主动协助的开放式本质给可靠评估带来挑战。为弥合这些空白,我们提出ProEvent——首个事件中心基准,评估智能体基于持续即时通讯聊天主动维护用户时间表的能力。ProEvent提供考虑用户动态互动、并发聊天线程与真实世界噪声的合成但真实的聊天,并在响应时机、单步响应正确性与多步响应正确性上评估主动智能体。对八个LLM与管线的实验显示:当前智能体频繁过度行动且难以处理事件取消;值得注意的是,即使GPT-5.1也只有26.7%的场景做出正确反应。进一步的定性分析揭示当前LLM作为主动智能体的根本局限,尤其在检测隐式事件与从用户第一人称视角推理方面。

ProEvent:面向主动式智能体的事件中心基准:论文配图
图 1:时间表维护任务图示。主动代理需要通过主动从左侧的聊天中寻找信息来维护右侧的时间表。 DtD_{t} 指的是在 t−1t-1 和 tt 之间接收到的消息。 StS_{t}指用户在时间tt的时间表。