论文

VLM教师向视觉文档检索器传递了什么?

What Transfers from a VLM Teacher? Comparing Supervision Signals for Visual Document Retrieval

模型优化上下文与知识模型评测检索增强蒸馏模型行为与机制分析

摘要

视觉文档检索器通过对比学习训练:每个查询靠近一个被标记为相关的正例页面,远离被假定不相关的负例页面。近期方法通过丰富正例,把视觉语言模型(VLM)教师对正例的注意力或描述蒸馏给检索器。我们研究教师是否更适合用于另一侧,即判断检索器挖掘出的负例候选,而标签并未说明这些候选是否真不相关。在固定学生、数据、优化器和评测的条件下,教师判定的困难负例与分数蒸馏,分别把ViDoRe v2 nDCG@5从55.2提高到62.6和63.0;本文适配的描述对齐提高2.6分,注意力接地则没有可测量收益。与在相同训练计算量下、从同一候选池选出四个候选的无教师规则比较,其中最强者是当前系统采用的正例感知阈值,教师判断额外提高v2和v3成绩4.1与1.7分。这与标签不完整相符:标注者认为每个查询排名最高的四个挖掘候选中约有两个相关,但它们都没有相关标签,因此训练会把检索器推离被误当负例的相关页面。传给学生的信息较粗:在贪婪解码的0至100分评分提示下,82%的教师评分位于量表两端之一,而仅区分相关与不相关就能保留大部分蒸馏收益。十位标注者的审计显示,教师表现处于人类标注者的变异范围内,在查询具有唯一确定答案时较可靠。我们开放代码、教师的330万条判断和页面描述、挖掘候选池、人工审计及训练适配器:https://github.com/elastic/vdr-teacher-signals。