论文
EgoBabyVLM:基于自然自我中心视频数据的跨模态学习基准测试
EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
摘要
儿童从有限的视觉语言输入中获得具有显着鲁棒性的语言基础,其方式超越了当今最好的大型多模态模型。最近的研究表明,当前基于精选网络数据训练的视觉语言模型(VLM)无法推广到由可穿戴设备、实体代理和婴儿头戴摄像头产生的稀疏、弱对齐的自我中心流,并且不存在固定的评估管道来衡量这一制度的进展。我们在视觉和语言输入之间具有不同程度的语义对齐的数据集(包括自然主义婴儿和成人自我中心视频)上训练 VLM,并使用涵盖多模态语言基础和单模态视觉和语言任务的综合套件对其进行评估。该套件的核心是 Machine-DevBench,这是一个基于语料库的词汇和语法能力基准,从跨对数频率箱的模型训练词汇自动生成,以消除先前开发基准的训练/评估不匹配和低统计能力。我们的结果表明,当前的 VLM 范式取决于精选数据的严格语义对齐,而未能利用主导自然主义自我中心输入的弱对齐信号——而这正是人类赖以生存的制度。为了激励进步,我们引入了 EgoBabyVLM 挑战赛,以推动能够从人类婴儿经历的自然数据中学习基础语言的模型的开发。