论文
T-IMPACT:上下文图像文本操作的严重性感知基准
T-IMPACT: A Severity-Aware Benchmark for Contextual Image-Text Manipulation
摘要
视觉语言模型和生成编辑系统的最新进展使得通过改变图像、文本或同时改变两者来产生有说服力的多模态错误信息变得越来越容易。然而,现有的数据集主要关注真实性、脱离上下文的不匹配或操纵类型,很少捕获编辑对帖子可能的解释的改变程度。我们推出了 T-IMPACT,这是一个针对受操纵的新闻风格图像文本对的首次发布的严重性感知基准。 T-IMPACT 包含 98,786 个示例,涵盖原始、纯图像、纯文本和联合操作,具有校准的连续严重性信号、粗略的低/中/高标签以及支持定位依据元数据。从新闻图像-文本对开始,管道提取语义锚点,在空间上定位它们,执行本地化图像编辑和受限图像描述重写,并使用有限的人类评级来校准上下文影响分数。在此版本中,校准的连续分数是主要严重性目标,而低/中/高带应解释为粗略操作桶而不是平衡类别。实验表明,当前的模型恢复了一些真实性信号,但严重性预测仍然困难得多,并且与人类判断的一致性很弱。 T-IMPACT 为研究超越二元真/假分类的多模式操作提供了初步基准,以实现分级上下文影响。