论文

语言在多模态模型中应该处于什么位置?语言对人类感知和认知的作用的教训

Where Should Language Sit in a Multimodal Model? Lessons from What Language Does to Human Perception and Cognition

模型评测模型行为与机制分析

摘要

语言模型通过标记进行计算:语言是它们的输入、输出,并且越来越多地是它们的内部表示。语言是否应该保留所有这些位置取决于语言对使用它的系统的作用。在这个问题上拥有一个世纪数据的系统就是人类。我们回顾了语言对人类感知、大脑和思维的影响,并阅读了针对多模态模型和语言模型的相同证据。自始至终,我们将语言视为在共享密码本上运行的压缩器:单词是索引,内容位于接收器中,社区维护密码本。对于人类来说,这种压缩是可以测量的,学习密码本可以重新组织感官,并且思想可以在语言丧失后幸存下来。然后,我们通过对六个视觉语言模型和两个机器人策略的线索冲突实验来衡量当两个线索不一致时模型应用的规则。幸存的线索按照其可靠性规定的顺序进行加权,为理想观察者斜率的 11% 到 82%,并且许多答案复制了文本。一个策略系列放弃了一个不添加任何超出其他信息的提示,而不是降低其权重,另一个策略系列将其保持在一个当提示冲突时失败的权重,并且永远不会学习在每个训练框架中识别任务的视觉提示,因为语言路径已经适合数据。语言模型是人类语言网络当前最好的模型,它们已经进入人类语音社区,改变了词频,同时对齐缩小了它们的概念多样性。我们以对基于词元的系统的七个影响作为结束语。语言属于模型的边界和共享密码本,就像在大脑中一样,而不是作为其内部表示;将密码本留在内部的代价是可审计性。