论文

双编码器中绑定的限制

The Limits of Binding in Dual Encoders

模型评测模型行为与机制分析

摘要

双编码器模型(例如 CLIP)通过两个独立计算的单位向量的单个内积对图像标题对进行评分,并且在绑定时失败,当被要求区分“红色汽车和蓝色狗”与“蓝色汽车和红色狗”时,通常得分接近机会。我们对何时这种失败是必要的以及何时是偶然的给出了数学解释。在 Kang 等人提出的理想编码器框架内,我们首先证明相关公理是可满足的,因此每个不可能性都必须通过一个附加的、可检查的假设来进入。然后我们证明三个这样的障碍。深度:对于递归角色绑定代码,交换边际在嵌套深度 D 中遵循精确的定律 $m(D) = 2b^{-D}$,有限维版本最多支持一个明确标记的浓度估计;可解析深度在维度上仅以对数方式增长,并且在 CLIP 尺度(普通语言的嵌套深度)下为个位数。目标:无体系结构的节流定理表明,对比目标的整个绑定奖励受训练将标题与其自身交换进行对比的速率所限制,该速率在网络规模上消失,并且精确反转的绑定成本仅为该速率乘以平均绑定余量;两者均在仿真中得到验证。几何:紧密的平滑度绑定边界:两个与交换相关的标题嵌入到共享释义锚点的距离越近,绑定边距可以越小,并且具有精确的常数。通过 18 个已部署的文本编码器测量其纯文本诊断,每个模型大约处于其上限的 25-35%,并且诱导的每项上限跟踪 SugarCrepe 的子集难度,r = 0.99。因此,如今部署的双编码器中的绑定失败不是维度或平滑度限制,而是激励和代码结构限制,一旦这些限制得到修复,就会保留经过验证的深度上限。