论文
视觉语言模型的动态人类偏好数据集
A Dataset for Dynamic Human Preferences for Vision Language Models
摘要
鉴于视觉语言模型(VLM)在人类交互环境中的采用越来越多,我们评估这些模型适应不同用户实时偏好的能力非常重要。虽然最近推出了越来越多的视觉语言基准,但它们主要侧重于评估静态功能和从大量训练数据中学习到的普遍偏好。这项工作引入了一个新的基准,用于评估 VLM 理解动态人类偏好的能力,即在推理时在上下文中传递的偏好。我们提供了一个自动管道来生成该基准,其中包含图像依赖性的变化、动态多模式人类偏好数据集以及在新基准上对最先进模型的评估。