论文

DIVA:面向视觉语言动作策略的意图感知视觉抑制

DIVA: Dual-Space Intent-Aware Visual Attenuation for Vision-Language-Action Policies

模型架构应用与实践Transformer机器人

摘要

视觉-语言-动作(VLA)策略通常将密集的视觉补丁标记输入到语言-动作主干中,保留场景上下文,但没有提供明确的机制来调节不同视觉标记对策略计算的影响程度。我们推出了 DIVA,一种双空间意图感知视觉衰减模块,采用锚定然后衰减设计。 DIVA 将高级任务意图与低级视觉证据相结合,以估计补丁式相关性锚点,然后将它们应用到两个互补的空间中:它在骨干网入口之前重新加权投影的视觉标记,并持续减弱骨干网内的低相关性视觉状态。 DIVA 保留完整的视觉Token序列,不需要外部Grounding监督。在 LIBERO 上,DIVA 将 OpenVLA-OFT 的平均成功率从 96.6% 提高到 98.0%,并将其零样本 LIBERO-Plus 得分从 69.6 提高到 72.6。现实世界的实验进一步显示了在与任务无关的视觉扰动下的一致增益,支持了意图感知视觉衰减超越模拟的稳健性。

DIVA:面向视觉语言动作策略的意图感知视觉抑制:论文原图
图 2:DIVA 任务“打开炉子并将摩卡壶放在上面”的概述。 DIVA 首先通过 Grounded Text Pooling 获得紧凑的任务表示,并根据任务条件的视觉标记估计补丁式相关锚点。然后,相同的锚点用于双空间视觉衰减:显式输入空间衰减在主干输入之前重新加权投影视觉标记,而隐式潜在空间衰减持续削弱主干层上的低相关性视觉隐藏状态。