论文

FoodSense:用于从图像预测味道、气味、质地和声音的多感官食品数据集和基准

FoodSense: A Multisensory Food Dataset and Benchmark for Predicting Taste, Smell, Texture, and Sound from Images

模型评测基准与评测资源

摘要

人类通常从食物图像中推断味道、气味、质地甚至声音,这是认知科学中深入研究的现象。然而,之前对食物的视觉语言研究主要集中在识别任务上,例如膳食识别、成分检测和营养估计。基于图像的多感官体验预测在很大程度上仍未得到探索。我们引入了 FoodSense,这是一个用于跨感官推理的人工注释数据集,包含 2,987 个独特食物图像中的 66,842 个参与者图像对。每对都包含四个感官维度的数字评级 (1-5) 和自由文本描述符:味道、气味、质地和声音。为了使模型能够预测和解释感官期望,我们将简短的人类注释扩展到基于图像的推理轨迹。 大语言模型 生成以图像、评级和描述符为条件的视觉理由。使用这些注释,我们训练 FoodSense-VL,这是一种视觉语言基准模型,可以直接从食物图像中生成多感官评分和基于图像证据的解释。这项工作将跨感官知觉的认知科学发现与多模态模型的现代指令调整联系起来,并表明许多流行的评估指标不足以进行视觉感官推理。