论文
迷失在单一向量中:通过块证据聚合改进长文档检索
Lost in a Single Vector: Improving Long-Document Retrieval with Chunk Evidence Aggregation
摘要
密集检索将一个查询向量与一个文档向量进行排名。对于长文档,如果在排序之前的文档编码过程中削弱了短暂但决定性的跨度,则此接口可能会失败。我们将这种失败模式研究为文档端早期压缩,并引入证据稀释指数(EDI)来衡量文档级表示低于同一标准相关文档中最强的块级证据的程度。在这一观点的指导下,我们提出了 DICE(通过块证据进行文档推理),这是一种 无需训练 文档端策略,它将文档分割成块,使用冻结模型独立编码它们,并将它们聚合回单个向量,同时保留标准的单查询单文档接口。在 LongEmbed 上,DICE 改进了四个骨干网的检索,其中超过 4k 词元的切片收益最大:对于 Dream,Passkey >4k 从 30.0 上升到 90.0,Needle >4k 从 23.3 上升到 74.0。在 12,779 个过滤样本中,DICE 在 92.8% 的情况下产生的 EDI 低于单向量基线。这些结果将文档级编码确立为长文档检索的实用且尚未充分开发的杠杆。