论文
CLAMP:视觉语言具身规划的约束解码
CLAMP: Constrained Decoding for Vision-Language Embodied Planning
摘要
具身规划越来越依赖视觉语言模型(VLM)将指令和视觉观察转化为可执行的动作序列。然而,流畅的计划并不总是可执行的。 VLM 可能会引用无法在视觉上观察到的对象,选择所需功能不可用的操作,或者违反语法和操作约束。我们引入了 CLAMP,这是一种多模态约束基础框架,可将场景证据转化为冻结 VLM 规划器的解码时间约束。 CLAMP 使用初始观察将对象引用限制为场景支持的对象引用,同时提供的符号动作模型指定状态转换和目标。在解码过程中,硬掩码会消除无效的下一个Token候选,而基于隐马尔可夫模型 (HMM) 的世界状态前瞻模块则根据操作先决条件和目标可达性重新加权剩余可行候选的概率。这使得计划者可以事先保留 VLM 的语言,同时防止视觉上不受支持、不安全或不可行的候选人进入计划。对于未见过的任务和环境,CLAMP 在测试时使用从冻结的 VLM 中采样的无标签延续来调整 HMM。 VLABench、SafeAgentBench 和 TaPA 上的实验表明,场景接地约束可以改善对象接地和安全性,而大多数剩余故障源于感知错误或未对齐的约束规范。