论文

现在询问,稍后使用:对长期存在的 LLM 代理的主动性差距进行基准测试

Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents

智能体系统Agent任务评测

摘要

长期存在的 LLM 代理(例如 OpenClaw)通过根据用户的偏好和跨会话的约束(而不仅仅是当前请求)来获取其价值。然而,今天的代理保留了用户自愿提供的内容,但很少要求未说出的内容,从而在长期存在的 LLM 代理中留下了主动性差距:代理无法根据其从未获得的偏好采取行动。随着用户将更多事务委托给代理,这种差距的影响就会越来越大。我们将这一差距的一个具体的、可控的部分隔离为请求记住(ATR):代理决定是否现在询问当前任务不需要但稍后与同一用户进行的会话需要的可重用用户首选项。 ATR 甚至很难评估:正确的问题尚未确定,其回报推迟到可能永远不会出现的任务。据我们所知,ATRBench 是第一个 ATR 基准测试,它通过将每个用户的偏好固定为隐藏的 真值 来使其可测量,因此成功需要询问,而不是回忆。在 8 个前沿 LLM 代理中,违约率比预言机提供的相关偏好低至少 62 个点,并且提示几乎无法关闭其中的一部分。诊断将采集确定为瓶颈。 ATRBench 揭示了当前代理中的主动性差距,并提供了一个诊断测试平台来弥补这一差距。