论文

HippoCamp:个人计算机上的情境化智能体基准评测

HippoCamp: Benchmarking Contextual Agents on Personal Computers

智能体系统Agent任务评测长程任务评测

摘要

我们提出HippoCamp,这是一个旨在评估智能体多模态文件管理能力的新基准。与现有专注于网页交互、工具使用或通用环境下软件自动化等任务的智能体基准不同,HippoCamp在以用户为中心的环境中评估智能体,要求其建模个体用户画像并检索海量个人文件以进行情境感知推理。我们的基准在跨越多种模态的真实用户画像之上构建了设备规模的文件系统,包含超过2K个真实文件、共42.4 GB的数据。在原始文件的基础上,我们构建了581个问答(QA)对,以评估智能体在搜索、证据感知和多步推理方面的能力。为支持细粒度分析,我们提供了46.1K条密集标注的结构化轨迹,用于逐步失败诊断。我们在HippoCamp上评估了多种最先进的多模态大语言模型(MLLM)与智能体方法。全面的实验揭示出显著的性能差距:即使是最先进的商业模型,在用户画像任务上的准确率也仅为48.3%,在密集个人文件系统中的长程检索与跨模态推理上尤为吃力。此外,逐步失败诊断将多模态感知与证据定位确定为主要瓶颈。归根结底,HippoCamp暴露了当前智能体在现实的以用户为中心环境中的关键局限,并为开发下一代个人AI助手提供了坚实基础。

HippoCamp:个人计算机上的情境化智能体基准评测:论文配图
图 1:HippoCamp Benchmark 中的任务概述。 HippoCamp 是一个基准测试,旨在评估智能体在长期、现实、大规模个人文件系统上搜索、感知和推理的能力。它再现了多模态数字环境,其中包含跨不同模式的数十 GB 的用户特定资产。通过需要扎根检索、跨文件模式推理和长视野推理的任务,该基准严格评估上下文代理的个性化多模态记忆。