论文
人类会梦见电子羊吗?用于细粒度视觉和语言幻觉基准测试的人类书写样本
Can Humans Dream of Electric Sheep? Human-Written Samples for Fine-Grained Vision-and-Language Hallucination Benchmarking
摘要
在模特快速更替的时代,如何让幻觉评价更加常青?我们探索人类编写的幻觉样本是否可以取代模型生成的幻觉,以便使基准检测独立于特定模型。为此,我们构建了一个包含 1,600 个人类书写样本的数据集,涵盖四种语言(中文、英语、法语、意大利语),以及来自五个视觉和语言模型的 18,400 个样本,所有这些样本都使用细粒度的跨级标签方案进行了幻觉注释。我们发现,人类编写的样本具有更高的一致性,并且可以更好地控制数据集内容,同时在分布上与来自视觉和语言样本的样本保持相似,并提供检测能力的合理描述——这表明人类数据是基于模型的幻觉基准的可行替代品。