论文
VibeLifeBench:您的生活智能体能否在现实世界中积极主动并坚持不懈?
VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?
摘要
大语言模型 (LLM) 代理越来越多地部署为个人助理。然而,现有的评估大多在静态环境中使用简短的、独立的请求。日常生活援助有所不同。任务运行数周而不是几分钟。世界在不断变化,而代理却没有得到提示。许多限制从未被直接说明。仅仅回答前面的请求的代理将无法完成这样的任务。相反,我们需要的是一个保持主动和始终如一的代理。它自行决定何时采取行动、何时提出要求以及何时保持沉默。它注意到没有人宣布的变化。它使计划从第一天到最后一天保持一致。当前没有基准衡量这一点。我们推出了 VibeLifeBench,这是涵盖 10 个日常生活领域的 200 项长期任务的基准。每项任务都是在 22 个模拟服务的模拟世界中按脚本编写的多周时间线。世界按照自己的时钟前进,许多变化都是悄无声息的,因此只有重新审视世界的代理人才能发现它们。每项任务都通过细粒度的加权检查进行分级,这些检查仅读取代理实际留下的内容,包括最终状态、其行动的及时性以及是否遵守隐式约束。我们评估了七个前沿模型。他们的得分都很低,这表明当前的智能体距离帮助现实生活还有多远。我们将开源所有任务、环境和评估框架。