论文

ProGAL-VLA:通过视觉-语言-动作模型中的前瞻性推理进行视觉实体定位与对齐

ProGAL-VLA: Grounded Alignment through Prospective Reasoning in Vision-Language-Action Models

智能体系统Agent 规划

摘要

视觉语言动作(VLA)模型可以实现多面手机器人代理,但经常表现出语言无知,依赖视觉捷径并对指令变化不敏感。我们提出了前瞻性视觉定位与对齐 VLA (ProGAL-VLA),它构建了一个以实体为中心的 3D 图 (GSM),使用慢速规划器来生成符号子目标,并通过视觉实体定位与对齐对比 (GAC) 损失将它们与已定位的实体对齐。所有动作都以嵌入 $g_t$ 的经过验证的目标为条件,其注意力熵提供了内在的模糊性信号。在 LIBERO-Plus 上,ProGAL-VLA 将机器人扰动下的稳健性从 30.3% 提高到 71.5%,将语言无知率降低 3 倍到 4 倍,并将实体检索从 0.41 Recall@1 提高到 0.71。在自定义模糊性基准上,它达到了 AUROC 0.81(对比 0.52)、AUPR 0.79,并将模糊输入的澄清从 0.09 提高到 0.81,而不损害明确的成功。验证瓶颈增加了语言动作的互信息,GAC 损失施加了实体级 InfoNCE 界限,注意力熵产生了校准的选择性预测,表明显式验证基础是通往指令敏感、歧义感知代理的有效路径。