论文

DiningBench:饮食领域感知和推理的分层多视图基准

DiningBench: A Hierarchical Multi-view Benchmark for Perception and Reasoning in the Dietary Domain

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 的最新进展彻底改变了一般视觉理解。然而,它们在食品领域的应用仍然受到依赖于粗粒度类别、单视图图像和不准确元数据的基准的限制。为了弥补这一差距,我们引入了 DiningBench,这是一个分层的多视图基准测试,旨在评估三个认知复杂性级别的 VLM:细粒度分类、营养估计和视觉问答。与之前的数据集不同,DiningBench 包含 3,021 种不同的菜肴,平均每个条目有 5.27 张图像,结合了来自相同菜单的细粒度“硬”负片和严格的、基于验证的营养数据。我们对 29 个最先进的开源和专有模型进行了广泛的评估。我们的实验表明,虽然当前的 VLM 擅长一般推理,但它们在细粒度视觉辨别和精确营养推理方面表现不佳。此外,我们系统地研究了多视图输入和思维链推理的影响,确定了五种主要故障模式。 DiningBench 是一个具有挑战性的测试平台,可推动下一代以食品为中心的 VLM 研究。所有代码均发布于https://github.com/meituan/DiningBench。