论文

TriRelVLA:可概括化体现操作的三元关系结构

TriRelVLA: Triadic Relational Structure for Generalizable Embodied Manipulation

摘要

视觉-语言-动作(VLA)模型在训练见过的机器人任务上表现良好,但很难推广到看不见的场景和物体。一个关键的限制在于它们的隐式视觉表示,它使对象外观、背景和场景布局纠缠在一起。这使得策略对视觉变化敏感。先前的工作通过客观化视觉内容的结构化中间表示来提高可转移性。然而,这些表示主要捕获场景语义而不是动作相关关系。因此,动作预测仍然与外观统计数据相关。我们观察到操纵动作取决于对象-手-任务关系结构,该结构控制任务要求、机器人状态和对象属性之间的交互。基于这一观察,我们提出了 TriRelVLA,一种用于可泛化体现操作的三元关系 VLA 框架。我们的方法由三个组成部分组成:1)我们从多模态输入构建显式的对象-手动-任务三元表示作为关系基元。 2)我们构建一个基于任务的关系图。任务引导的交叉注意力形成节点,关系感知图 Transformer 对它们之间的交互进行建模。 3)我们执行关系条件动作生成。关系结构被压缩到瓶颈空间并投影到 LLM 中以进行动作预测。这种三元关系瓶颈减少了对外观统计的依赖,并实现了跨场景、对象和任务组合的传输。我们进一步介绍了 微调 的真实机器人数据集。实验表明,在微调任务上有很强的性能,并且在跨场景、跨对象和跨任务泛化方面有明显的进步。