论文
相信你的记忆:通过多维奖励强化学习实现可验证的智能家居控制
Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards
摘要
大语言模型(LLM)已成为实现个性化智能家居体验的关键基础。尽管现有研究已探索智能家居助手如何理解用户查询以实时控制设备,但其执行记忆驱动设备控制的能力在评测与方法两个层面仍具挑战。在评测方面,现有基准要么聚焦即时设备控制,要么聚焦通用的开放域记忆检索任务,因此无法有效评估模型执行记忆驱动设备控制的能力。在方法层面,虽然记忆驱动的设备控制可以借助强化学习来解决,但传统RL方法通常依赖基于结果的监督(即最终任务是否达成)。这种中间反馈的缺失会导致细粒度记忆管理任务(添加、更新、删除与利用)中的次优表现或局部失败。为解决这些问题,我们首先发布MemHomeLife,它基于匿名化的真实世界长期用户交互日志构建。为了对不同记忆相关子任务进行更细粒度的评估,我们进一步构建了MemHome,首个旨在系统评测智能家居场景中记忆驱动设备控制的基准。
