论文
HippoCamp:个人计算机上的情境化智能体基准评测
HippoCamp: Benchmarking Contextual Agents on Personal Computers
摘要
我们提出HippoCamp,这是一个旨在评估智能体多模态文件管理能力的新基准。与现有专注于网页交互、工具使用或通用环境下软件自动化等任务的智能体基准不同,HippoCamp在以用户为中心的环境中评估智能体,要求其建模个体用户画像并检索海量个人文件以进行情境感知推理。我们的基准在跨越多种模态的真实用户画像之上构建了设备规模的文件系统,包含超过2K个真实文件、共42.4 GB的数据。在原始文件的基础上,我们构建了581个问答(QA)对,以评估智能体在搜索、证据感知和多步推理方面的能力。为支持细粒度分析,我们提供了46.1K条密集标注的结构化轨迹,用于逐步失败诊断。我们在HippoCamp上评估了多种最先进的多模态大语言模型(MLLM)与智能体方法。全面的实验揭示出显著的性能差距:即使是最先进的商业模型,在用户画像任务上的准确率也仅为48.3%,在密集个人文件系统中的长程检索与跨模态推理上尤为吃力。此外,逐步失败诊断将多模态感知与证据定位确定为主要瓶颈。归根结底,HippoCamp暴露了当前智能体在现实的以用户为中心环境中的关键局限,并为开发下一代个人AI助手提供了坚实基础。
