论文

PersonalHomeBench:在个性化智能家居中评估智能体

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

智能体系统Agent任务评测

摘要

智能体AI系统正快速迈向真实世界应用,但其在复杂且个性化环境中的就绪程度仍缺乏充分刻画。为填补这一空白,我们提出PersonalHomeBench,一个用于评估基础模型在个性化智能家居环境中作为智能体助手表现的基准。该基准通过一个迭代过程构建:逐步建立丰富的家庭状态,再用其生成个性化的、依赖上下文的任务。为支持真实的智能体-环境交互,我们提供PersonalHomeTools,一个支持家庭信息检索、电器控制和情境理解的综合工具箱。PersonalHomeBench在单模态和多模态观测下评估反应式与主动式两类智能体能力。大量实验揭示,随着任务复杂度上升性能出现系统性下降,在反事实推理和部分可观测(需要基于工具的有效信息收集)的情形下失败尤为突出。这些结果使PersonalHomeBench成为分析个性化智能体推理与规划的鲁棒性和局限性的严格评估平台。

PersonalHomeBench:在个性化智能家居中评估智能体:论文配图
图 1:PersonalHomeBench 数据生成管道概述。详细的家庭环境首先由角色、设备、记忆和上下文描述以及可选的视频接地组合而成。然后从这些环境中生成五类个性化任务,涵盖反应性问答和主动协助,从而能够评估个性化智能家居设置中的代理行为。