论文
(V)LM 超越表面共现:来自跨模态数一致性的证据
(V)LMs generalize beyond surface co-occurrence: Evidence from cross-modal number agreement
摘要
语言模型主要从共现中学习语法数,并因此显示出频率效应——有时表明它们不学习抽象的“规则”,而是依赖于特定的词汇项。仅用文本刺激来测试泛化能力并不能解决这个争论,因为分布线索(是/是,这个/这些)很容易泄露数字。相反,我们使用跨模态泛化作为工具来研究也可以接受视觉输入(VLM)的语言模型中的抽象,从而将诊断数字的证据限制为语言外模态。我们通过添加新的嵌入并仅在学习过程中更新它们来教授 VLM 对新名词,将仅通过视觉提示诊断数字的条件与通过文本消除歧义的条件进行比较。在行为、表征动态和因果机制方面,我们发现了跨两种暴露条件的跨模态泛化的重要证据,并且在模型的内部机制中以类似的方式处理语言与语言外提示条件。这表明像 VLM 这样的统计学习器可以泛化到表面层面的共现之外,并表现出真正的抽象兼容行为。