论文
CulturalMenuBench:探测多模态烹饪推理中的知识与应用鸿沟
CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning
摘要
多模态语言模型在食品识别基准上取得了接近上限的分数,但目前尚不清楚这种成功是否反映了真正的文化理解或仅仅是视觉匹配。为了探究这一区别,我们引入了 CultureMenuBench,这是一个包含 18 个地区、10 种语言的 4,870 个项目的基准;它的 10 项任务将最终菜肴和逐步烹饪图像与配料、程序文本和区域标签配对,涵盖基本识别到基于流程的文化归因。评估 12 个模型暴露了巨大的知识应用差距:尽管采用相同的四向格式,但在标准多项选择任务上超过 94% 的模型在将菜肴归因于中国地方美食时下降至最多 56%。诊断分析解释了原因:错误模式与随机猜测一致,准确性跟踪视觉独特性而不是文化结构,模型仅根据菜肴名称对菜肴进行分类比根据图像更准确(+7-18 分)。因此,知识是存在的,但不能通过视觉输入激活。消融证实这些任务确实需要程序证据:删除顺序烹饪图像会选择性地降低基于流程的任务,而其他任务则保持稳定。总体而言,CulturalMenuBench 表明,近乎完美的识别可以掩盖应用文化知识的无能,从而激发将感知、程序和文化背景明确联系起来的训练。代码和数据是公开的。
