论文

是什么使语言表征成为人脑高级视觉感知的良好模型?

What Makes Linguistic Representations Good Models of High-Level Visual Perception in the Human Brain?

模型评测模型行为与机制分析

摘要

用语言模型(LM)表示的图像描述可以预测人脑对高级视觉区域的自然图像的反应,但驱动这种预测的因素仍不清楚。为了研究这个问题,我们系统地研究了如何描述图像以及使用哪些语言模型来嵌入这些描述。对于一组常见的图像,我们考虑了六种标题类型(包括人工注释的标题和多个机器生成的标题),它们在多个维度上有所不同。每个标题都用五个 LM 表示,涵盖经过训练以预测即将出现的单词和文本嵌入器的自回归 LM,即针对需要句子/文档级表示的语义任务进行微调的 LM。机器生成的字幕产生了显着的大脑预测性和一致性,通常超过了之前工作中使用的人工注释字幕。在各种字幕类型中,文本嵌入器的性能始终优于自回归 LM,这是在通过图像相似性判断衡量行为一致性时复制的模式。对不同模型层的标题表示的分析进一步表明,在被认为标志着句法和语义结构出现的点之后不久,大脑的预测性和行为对齐在中间网络深度达到峰值。总而言之,我们的结果表明,图像标题的内容和用于表示它们的 LM 都会影响大脑和行为建模的性能,从而将标题嵌入确立为研究高级视觉感知的有用工具。