论文
LEEVLA:了解潜在环境进化中视觉-语言-行动的重要因素
LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action
摘要
视觉-语言-动作(VLA)模型旨在将多模态输入映射到机器人动作。然而,大多数现有方法难以覆盖复杂的动态场景,因为统一处理所有视觉标记并使用人类选择的因素进行推理,缺乏强调任务关键证据并忽略潜在因素的机制。为了解决这个问题,我们提出了 LEEVLA,这是一种 VLA 架构,用于了解潜在环境演化中重要的内容,它明确引导模型走向信息区域,同时保留潜在世界表示的结构化演化。为了识别显着和指令相关的区域,我们引入了漂移引导动态优先级(DGDP),它将动态位置优先级(DPP)与语义漂移指导(SDG)相结合,以指导 VLA 代理在训练期间参加哪里。除此之外,我们引入了结构化特征流生成(SFFG),它通过原型到外围(P2P)预测来模拟这些优先特征如何在潜在空间中演化,以及相互邻域对比(MC)损失以保持邻域之间的拓扑一致性。 DGDP 和 SFFG 共同构成了一个任务感知的“地点-如何”训练框架。 VLA 基准的大量实验表明,LEEVLA 始终优于先前的方法,这证实了明确的任务证据指导和结构化潜在推理对于可扩展的 VLA 都至关重要。我们的代码可在 https://github.com/LyuQi127/LEEVLA 获取。