论文
视觉-语言-动作模型的潜在聚类分析
Latent Cluster Analysis for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型越来越多地用于机器人技术,因为它们能够将语言和感知转化为行动,但驱动其行为的内部表征仍然知之甚少。我们提出了 LAVLA,一种用于 VLA 模型潜在聚类分析的框架,并对最先进的 GR00T N1.5 模型进行了分层研究,特别关注其动作解码器。为了更好地表征动作扩散过程中的潜在空间,我们引入了一种基于交叉注意力的嵌入加权方法,该方法可以放大相关特征,同时抑制信息量较少的特征。定量评估表明加权聚类始终优于基线。为了提高可解释性,我们为每个集群提取人类可解释的概念,将潜在表示与语义描述联系起来。我们的分析表明,潜在簇逐渐解开时空和运动学特征,中间层的表示变得更加精细,并朝着输出稳定。因此,LAVLA 提高了语言驱动的机器人系统的可解释性。