论文
DIVA:面向视觉语言动作策略的意图感知视觉抑制
DIVA: Dual-Space Intent-Aware Visual Attenuation for Vision-Language-Action Policies
摘要
视觉-语言-动作(VLA)策略通常将密集的视觉补丁标记输入到语言-动作主干中,保留场景上下文,但没有提供明确的机制来调节不同视觉标记对策略计算的影响程度。我们推出了 DIVA,一种双空间意图感知视觉衰减模块,采用锚定然后衰减设计。 DIVA 将高级任务意图与低级视觉证据相结合,以估计补丁式相关性锚点,然后将它们应用到两个互补的空间中:它在骨干网入口之前重新加权投影的视觉标记,并持续减弱骨干网内的低相关性视觉状态。 DIVA 保留完整的视觉Token序列,不需要外部Grounding监督。在 LIBERO 上,DIVA 将 OpenVLA-OFT 的平均成功率从 96.6% 提高到 98.0%,并将其零样本 LIBERO-Plus 得分从 69.6 提高到 72.6。现实世界的实验进一步显示了在与任务无关的视觉扰动下的一致增益,支持了意图感知视觉衰减超越模拟的稳健性。
