论文
视觉文档多向量索引的信息反演风险
Inverting Multi-Vector Visual Document Indices
摘要
流行的多向量视觉文档检索器将每个页面存储为大约一千个补丁向量,通常存储在第三方运行的向量数据库中。由于没有人可以从其向量中读取页面,因此该索引很容易被视为不如页面敏感。然而,由于索引按光栅顺序为每个补丁保留一个向量,并且每个向量都是由预先训练用于读取文档的视觉语言模型计算的,因此我们假设任何运行或破坏存储的人都可以仅从其索引重现页面。我们将反转定义为条件文档图像生成,并从向量推断出攻击所需的内容:编码器、页面形状以及对于打乱的向量而言,它们的顺序。在 ViDoRe v3 基准测试中,从原始索引反转的页面恢复了 47% 的单词和 45% 的敏感标记。当用作针对存储索引的查询时,它们在 98.4% 的情况下将源页面排在第一位。我们测试了两种廉价的保护措施:Token池和洗牌,它们都将单词召回率降低到 8% 左右。恢复打乱索引顺序的模型提高了排名的源页面的份额 首先从 3.8% 升至 93.5%,而反转汇总指数仍处于开放状态。为了测试泛化性,我们对另一个多向量检索器应用相同的攻击:它的反向页面在 70.2% 的时间里仍然将其源页面排名第一,尽管它的单词召回率仍然低于最近邻居基线。因此,多向量视觉文档检索器很容易通过其存储的索引进行反转,该索引应该像它编码的文档一样受到保护。
