论文
ProEvent:面向主动式智能体的事件中心基准
ProEvent: An Event-centric Benchmark for Proactive Agents
摘要
主动式智能体被期望通过感知环境上下文、在无显式指令的情况下预判用户需求并提供自主协助。这类智能体的基本能力是识别并跟踪用户即将发生的事件,从而提供持续的、事件特定的协助:例如记录一次计划徒步的时间地点后,提前发送天气提醒或在出发前提供导航支持。然而现有主动智能体工作大多忽视事件中心协助,且主动协助的开放式本质给可靠评估带来挑战。为弥合这些空白,我们提出ProEvent——首个事件中心基准,评估智能体基于持续即时通讯聊天主动维护用户时间表的能力。ProEvent提供考虑用户动态互动、并发聊天线程与真实世界噪声的合成但真实的聊天,并在响应时机、单步响应正确性与多步响应正确性上评估主动智能体。对八个LLM与管线的实验显示:当前智能体频繁过度行动且难以处理事件取消;值得注意的是,即使GPT-5.1也只有26.7%的场景做出正确反应。进一步的定性分析揭示当前LLM作为主动智能体的根本局限,尤其在检测隐式事件与从用户第一人称视角推理方面。
