论文
Appear2Meaning:从图像进行结构化文化元数据推断的跨文化基准
Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images
摘要
视觉语言模型 (VLM) 的最新进展改进了文化遗产的图像字幕。然而,从视觉输入推断结构化文化元数据(例如,创造者、起源、时期)仍然没有得到充分探索。我们为此任务引入了多类别、跨文化基准,并使用 LLM-as-Judge 框架评估 VLM,该框架可测量与参考注释的语义对齐情况。为了评估文化推理,我们报告了跨文化区域的完全匹配、部分匹配和属性级别的准确性。结果表明,模型捕获碎片信号,并在不同文化和元数据类型之间表现出巨大的性能差异,从而导致不一致且缺乏依据的预测。这些发现凸显了当前 VLM 在视觉感知之外的结构化文化元数据推理中的局限性。