论文

语言、视觉与动作表示之间的对齐

Alignment among Language, Vision and Action Representations

模型评测模型行为与机制分析

摘要

认知科学与AI中的一个根本问题是:语言、视觉与动作等不同学习模态,究竟产生独特还是共享的内部表示。传统观点假设,在不同数据类型上训练的模型会发展出专用的、不可迁移的表示。然而,近期证据显示意外的趋同:为不同任务优化的模型可能发展出相似的表示几何。我们研究这种趋同是否延伸到具身动作学习,方法是训练一个基于transformer的智能体,使其响应自然语言指令执行目标导向行为。通过在BabyAI平台上进行行为克隆,我们生成了完全由感知运动控制需求塑造的动作扎根语言嵌入。随后,我们将这些表示与从最先进大语言模型(LLaMA、Qwen、DeepSeek、BERT)与视觉-语言模型(CLIP、BLIP)提取的表示进行比较。尽管训练数据、模态与目标差异巨大,我们观察到稳健的跨模态对齐。动作表示与仅解码器语言模型及BLIP强烈对齐(precision@15:0.70-0.73),接近语言模型彼此之间的对齐水平。与CLIP和BERT的对齐则显著更弱。这些发现表明,语言、视觉与动作表示趋向部分共享的语义结构,支持模态无关的语义组织,并凸显具身AI系统中跨域迁移的潜力。