论文

Chehre:一个表情符号提示的数据集,用于探索视频语言模型中的感知灵活性

Chehre: An Emoji-Prompted Dataset to Explore Perceptual Flexibility in Video Language Models

模型评测基准与评测资源

摘要

人们以同样的方式感知相同的面部表情吗?我们是否应该期望视觉模型能够灵活地感知面部表情?面部表情是人类交互中使用的非语言社交信号,但面部表情识别数据集通常关注每个样本的单个确定性注释。我们引入了 Chehre,这是一个表情符号提示的视频数据集,具有各种动态面部表情,用于探索感知变化。在 Chehre 中,203 名参与者被要求表达并记录 40 个面部表情符号。后来,他们的面部动作被转移到合成脸上以保护隐私。一个单独的小组对视频进行了注释,最终形成了由 1,242 名感知者注释的 2,111 个视频,每个视频约有 30 个注释者。 Chehre 使我们能够定义一个新任务:“分布式表达识别”,它测试模型是否可以重现在注释者响应中观察到的变化。我们在我们的任务中测试了一系列视频语言模型。有趣的是,我们发现人物角色提示可以作为一种可控的方式来改变模型感知,同时帮助模型更好地捕捉人类注释者观察到的变化。数据集和代码可在 https://chehre-dataset.github.io/ 获取。