论文

ADAPT:未指明可供性约束下的常识规划基准测试

ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints

智能体系统Agent任务评测

摘要

具身智能体不应只是机械执行指令,因为现实环境常常包含意外情况与例外。然而,现有方法通常聚焦于直接执行指令,不考虑目标对象是否真的可以被操作,即无法评估可用的可供性(affordance)。为解决这一局限,我们提出DynAfford,一个在动态环境中评估具身智能体的基准,其中对象的可供性可能随时间变化且不在指令中说明。DynAfford要求智能体感知对象状态、推断隐含的前提条件,并相应调整自身动作。为实现这一能力,我们提出ADAPT,一个即插即用模块,通过显式可供性推理增强现有规划器。实验表明,引入ADAPT后在已见与未见环境中都显著提升了鲁棒性与任务成功率。我们还表明,经过领域适配、LoRA微调的视觉语言模型作为可供性推理后端优于商用LLM(GPT-4o),凸显了任务对齐的可供性接地(grounding)的重要性。

ADAPT:未指明可供性约束下的常识规划基准测试:论文配图
图 2:ADAPT 概述:可供性感知行动选择。 (a) 先前工作中使用的标准具体指令遵循管道,其中代理直接执行计划的动作序列,而不考虑动态可供性约束。 (b) 我们的 ADAPT 框架通过可供性意识增强了行动执行力。对于每个提议的动作,智能体首先执行第一阶段:功能可见性推理,联合考虑当前的观察结果和预期的动作。如果该操作被认为不适用(例如,微波炉被占用),则第 2 阶段:适用性解决方案将选择替代的可执行操作(例如,等待),而不是盲目执行原始计划。 (c) 可供性推理模块的架构,它将 LoRA 微调的视觉基础与多模态上下文学习相结合,使用检索到的可供性示例来推断对象可用性。