论文
DistilVDR:通过双学生蒸馏构建紧凑的端到端视觉文档检索器
DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation
摘要
视觉文档检索 (VDR) 以数十亿参数的模型为主,这些模型在全语料库规模下索引速度很慢,而且服务成本昂贵。先前的压缩路线要么从头开始训练较小的多向量编码器,要么仅提取查询端;两者都不会产生端到端的紧凑单向量 检索器。我们提出了 DistilVDR,这是一个 524M 端到端 VDR 系统,是在逐点余弦对齐损失下从单个 8B 视觉语言教师双边提取的。所有监督都来自冻结的教师嵌入空间,该空间本身是通过相关监督进行训练的,因此学生目标不需要相关标签、负采样或对比项。我们将 VDR 的文本查询和图像文档输入不对称性与仅使用非对称编码器的学生相匹配,该学生将视觉能力集中在文档侧,并将查询侧保持在 70M 参数。我们发布了两个共享相同编码器和训练的变体,仅在文档编码器的视觉块预算上有所不同:DistilVDR-HiRes 在 ViDoRe v1+v2+v3 上获得 61.74 平均 NDCG@5(8B 教师的 86.9%),并在高分辨率敏感的 v3 基准上领先于每个再现的 sub-1B 基线,而 DistilVDR-Fast 在小 3 倍的情况下获得 59.98视觉-词元预算。两种变体都在比最强的 sub-1B 多向量基线小 15.6 倍的索引中存储一百万个文档,并且索引语料库的速度快一个数量级。该代码可在 https://github.com/Ryenhails/NanoVDR 获取。