论文

具有排名感知奖励最大化的查询嵌入的测试时优化

Test-Time Optimization of Query Embeddings with Ranking Aware Reward Maximization

摘要

密集 检索器 使用冻结编码器和预先计算的索引之间的向量相似性对文档进行排名。虽然来自重新排名器或 LLM 判断的测试时排名奖励可以改善结果,但现有方法在单个查询后会丢弃此信号。更新 检索器 的权重使奖励可重复使用,但这需要参数访问,这对于闭源模型来说是不可用的,并且计算量巨大。我们提出了 TTT-Embed(嵌入的测试时调整),这是一个框架,可将排名奖励提炼成冻结模型的输出嵌入空间内的轻量级学习向量。该向量纯粹根据分配给 检索器 自己的候选文档的标量排名分数进行优化,不需要访问模型权重、真值 标签或对索引进行修改。单个范围参数控制奖励重用(全局、任务或查询),从而在固定奖励计算预算下实现可重用性和特异性之间的原则性权衡。我们证明,随着可用奖励预算的扩大,最佳共享范围会动态地从全局方式转变为任务方式,最后转变为查询方式。通过对 5 个嵌入模型和 15 个 MTEB 检索任务进行评估,TTT-Embed 将测试时检索提高了高达 +8.36 nDCG@10。至关重要的是,学习到的状态可以有效地推广到未见过的查询(高达 +8.57 nDCG@10)和未见过的任务(高达 +4.71 nDCG@10)。此外,TTT-Embed 成功解决了灾难性遗忘:通过完全冻结基础权重,它恢复了退化的一般能力(高达 +8.00 nDCG@10,甚至超过了原始基础模型),同时保留了领域内的专业化。这些结果将排名奖励建立为可重用的测试时间状态,从而能够以预算高效的方式适应任何嵌入模型,包括闭源 API。