论文

Symbal:检测模型生成的图像描述中的系统性错位

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 在生成图像描述时经常会引入错误,从而导致图像文本对错位。我们的工作重点是一类我们称为系统错位的图像描述错误,其中 MLLM 生成的图像描述中反复出现的错误与配对图像中特定视觉特征的存在密切相关。给定一个带有 MLLM 生成的标题的视觉语言数据集,我们这项工作的目标是检测此类错误,我们将这项任务称为系统错位检测。作为我们的第一个关键贡献,我们提出了 Symbal,它利用结构化的双阶段设置和现成的基础模型来识别系统偏差并用自然语言总结结果。作为我们的第二个关键贡献,我们引入了 SymbalBench,这是一个旨在评估我们提出的任务的自动化方法的基准。 SymbalBench 包含来自两个领域(自然图像和医学图像)的 170 万个图像文本对,组织成 420 个视觉语言数据集,并带有带注释的系统偏差。 Symbal 在此基准测试中表现出强大的性能,正确识别了 63.8% 数据集中的系统偏差,比最接近的基线提高了近 4 倍。我们用真实世界的评估来补充我们在 SymbalBench 上的评估,表明(1)Symbal 可以准确地显示四个 MLLM 生成的图像描述中的系统偏差;(2)Symbal 是审核现成图像图像描述数据集的强大工具。最终,我们的新颖任务、方法和基准可以帮助用户审核 MLLM 生成的标题并识别关键错误,而无需访问底层 MLLM。代码可在 https://github.com/Stanford-AIMI/Symbal 获取。