论文

嵌入模型如何绑定概念?

How can embedding models bind concepts?

模型评测模型行为与机制分析

摘要

人类可以轻松确定多对象场景中哪种颜色属于哪种形状,这种能力称为概念绑定。 CLIP 等视觉语言嵌入模型在绑定方面遇到了困难:它们识别单个概念,但无法表示哪些概念形成哪些对象。尽管 CLIP 在跨模态检索中的行为类似于概念袋模型,但对象信息可以分别从其图像和文本嵌入中恢复。我们通过绑定函数来研究这种张力,该函数将概念映射到场景嵌入。我们发现场景嵌入可附加地分解为对象表示,这解释了为什么单模态探针可以恢复对象信息。然而,CLIP 的绑定功能非常复杂,这可能会阻止图像和文本编码器学习可推广到未见过的概念组合的共享绑定机制。然后我们问这个限制是否是根本性的。我们证明事实并非如此。在从头开始训练的受控 Transformer 模型中,结合泛化随着足够的数据覆盖而出现。这些模型学习以概念之间的乘法交互为特征的低复杂性绑定函数,从而实现系统泛化。代码可在 https://github.com/oshapio/binding-concepts-complexity 上公开获取。