论文

SPIEval:评估 大语言模型 作为移动助理的分散个人信息

SPIEval: Evaluating Large Language Models as Mobile Assistants over Scattered Personal Information

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 越来越多地被部署为移动助手,其中一个关键挑战是利用分散在多个应用程序 (app) 中的个人信息来完成用户指令。然而,由于缺乏专门的基准测试,人们对它们的功能仍然知之甚少。为了解决这一差距,我们引入了 SPIEval,这是一个基于五种认知能力(即推理、消歧、整合、偏好推断和多意图分解)的人工基准测试。 SPIEval 包含 250 个任务,涵盖分布在 10 个应用程序中的 4,335 条个人记录,并通过 21 种工具支持多轮交互。分析表明,该基准测试场景多样、任务艰巨、信息分散、环境可控、结果可验证。我们评估了九个有代表性的 LLM 并发现了很大的改进空间。性能最好的模型 GPT-5.5 (xhigh) 仅达到 57.3% 的准确率,而最弱的仅达到 16.4%。进一步分析表明,79% 的失败源于不准确的信息定位,因为 LLM 经常承诺看似合理但不正确的信息,而不是继续检索进行验证。我们还发现,只有不到 2% 的检索操作采用高级搜索方法,并且观察到不同模型的搜索效率存在显着差异。这些发现揭示了当前基于 LLM 的移动助手的基本局限性,并激励了未来在这个方向上的研究。数据和代码可在 https://huggingface.co/datasets/Junjie-Ye/SPIEval 获取。