论文

连接价值与行为:主动式具身智能体的分层框架

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

智能体系统Agent 规划

摘要

当前的具身智能体往往局限于被动指令遵循或反应式需求满足,缺乏对长期自主行为和解决动机冲突至关重要的稳定高阶价值框架。我们提出ValuePlanner,一种将高层价值调度与低层动作执行解耦的分层认知架构。ValuePlanner采用基于LLM的认知模块,通过对抽象价值权衡的推理生成符号化子目标,再由经典PDDL规划器将其转化为可执行的动作计划。该过程通过闭环反馈机制不断改进。评估此类自主性需要超越任务成功率的方法,因此我们提出一套以价值为中心的评估套件,衡量累积价值增益、偏好一致性和行为多样性。在TongSim家庭环境中的实验表明,ValuePlanner能够仲裁相互竞争的价值,生成指令遵循和需求驱动基线所不具备的连贯、长时程、自主导向的行为。我们的工作为自主智能体连接内在价值与落地行为提供了一种结构化方法。

连接价值与行为:主动式具身智能体的分层框架:论文配图
图 1:代理认知范式的概念比较,将现有方法与我们提出的价值驱动自主权进行对比。 (左)任务驱动代理仅限于被动遵循指令,仅根据外部命令行事。 (中)需求驱动的代理是反应性的,由满足内部状态的即时需求(例如,较低的“清洁度”指标)触发。 (右)我们的价值驱动方法可实现主动自主。代理拥有高阶价值的内部框架(例如“管理权”、“安全环境”)。它通过抽象的价值权衡进行推理来解决相互冲突的动机,使其能够考虑优先采取哪些行动(例如,为“安全”稳定花瓶,为“管理”清理废物),以产生连贯的、自我导向的行为。