论文

SMH-Bench:面向环境锚定推理与动作的LLM智能体基准

SMH-Bench: Benchmarking LLM Agents for Environment-Grounded Reasoning and Action in Smart Homes

智能体系统Agent任务评测

摘要

智能家居正在向复杂的依赖于状态的生活环境发展,需要大型语言模型 (LLM) 来推理用户意图、偏好和多设备交互。然而,现有的智能家居基准测试通常侧重于静态指令到 API 的映射或有限的模拟,无法评估 LLM 是否可以在现实家庭场景中可靠地进行推理、交互和操作。为了解决这些限制,我们推出了 SMH-Bench,这是一个用于评估智能家居环境中大语言模型的综合基准。 SMH-Bench 基于可执行且可验证的智能家居模拟器 HomeEnv 构建,包含涵盖 7 个类别和 22 个细粒度子类别的 1,100 个高质量任务。它进一步对简单、中型和复杂家庭的任务进行分层,范围从小型公寓到拥有 135 台设备的密集多房间环境。实验表明,尽管前沿大语言模型在显式控制和查询任务上取得了很强的性能,但它们在自动化任务调度、歧义处理和个性化推理方面仍然表现出明显的弱点,特别是随着家庭复杂性的增加。我们希望 SMH-Bench 能够促进更可靠、上下文感知和实用部署的智能家居代理的开发。

SMH-Bench:面向环境接地推理与动作的LLM智能体基准:论文配图
图 1:SMH-Bench 概述。 SMH-Bench 通过 7 个能力类别、可扩展的家庭复杂性和混合评估协议的 1,100 项人工审核任务来评估代理。