论文

当机器人做家务时:面向长程家庭任务执行的基准与智能体

When Robots Do the Chores: A Benchmark and Agent for Long-Horizon Household Task Execution

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

长程家庭任务要求稳健的高层规划与持续推理能力,而现有具身AI基准大多强调短程导航或操作并依赖固定任务类别,基本忽视了这些能力。我们提出LongAct,一个旨在评估自由形式指令所指定的长程家庭任务中规划级自主性的基准。通过抽象掉与本体相关的底层控制,LongAct分离出指令理解、依赖管理、记忆维护和自适应规划等高层认知能力。我们进一步提出HoloMind,一个VLM驱动的智能体,具备基于DAG的长程分层规划器、用于持久世界建模的多模态空间记忆、用于经验复用的情景记忆,以及负责反思监督的全局Critic。基于GPT-5和Qwen3-VL模型的实验表明,HoloMind显著提升长程性能,同时降低对模型规模的依赖。即便最强模型也只能达到59%的目标完成率和16%的全任务成功率,这凸显了LongAct的难度以及具身智能体对更强长程规划的需求。

当机器人做家务时:面向长程家庭任务执行的基准与智能体:论文配图
图 1:LongAct 工作台概述。 LongAct 评估智能体执行长期家务任务的情况,这些任务涉及 500 多个人类步骤,并且需要在多房间环境中紧密耦合的导航和操作。该基准强调对数千个操作的持久推理、记忆和错误恢复,揭示了实现可靠的长期自治的挑战。