论文

相信你的记忆:通过多维奖励强化学习实现可验证的智能家居控制

Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

大语言模型(LLM)已成为实现个性化智能家居体验的关键基础。尽管现有研究已探索智能家居助手如何理解用户查询以实时控制设备,但其执行记忆驱动设备控制的能力在评测与方法两个层面仍具挑战。在评测方面,现有基准要么聚焦即时设备控制,要么聚焦通用的开放域记忆检索任务,因此无法有效评估模型执行记忆驱动设备控制的能力。在方法层面,虽然记忆驱动的设备控制可以借助强化学习来解决,但传统RL方法通常依赖基于结果的监督(即最终任务是否达成)。这种中间反馈的缺失会导致细粒度记忆管理任务(添加、更新、删除与利用)中的次优表现或局部失败。为解决这些问题,我们首先发布MemHomeLife,它基于匿名化的真实世界长期用户交互日志构建。为了对不同记忆相关子任务进行更细粒度的评估,我们进一步构建了MemHome,首个旨在系统评测智能家居场景中记忆驱动设备控制的基准。

相信你的记忆:通过多维奖励强化学习实现可验证的智能家居控制:论文配图
图 1. MemHome 中内存驱动的设备控制框架概述。给定用户查询、房间和布局,系统从存储器库中检索相关存储器,并且设备控制模型确定适当的控制行为。绿色表示无内存控制,直接执行指令。紫色代表内存状态更改,其中模型写入、更新或删除内存条目。红色表示内存使用情况,其中设备控制命令根据检索到的内存进行重写。