论文
通过代理程序搜索进行冻结嵌入模型的测试时计算
Test-Time Compute for Frozen Embedding Models through Agentic Program Search
摘要
人们普遍认为,测试时计算仅对大型推理模型有益,而小型模型则无济于事。我们认为密集检索相反,因为现代小型嵌入模型是从 大语言模型 主干中提取或改编的,并且可以继承其潜在的测试时间计算潜力。我们询问冻结嵌入模型仅在推理时获得了多少检索质量,没有辅助模型,也没有在部署时训练参数。 大语言模型 在冻结编码器 API 上编写程序的代理循环会探索 144 个候选程序,并生成 12 个帕累托最优程序,这些程序以推理计算换取质量,成本比率从 $c{=}1.2$ 到 $14.7$,每个程序在所有 14 个发现任务上都提高了 nDCG@10。该程序不使用可训练参数并恢复经典检索原语,其中包括倒数排序融合、Fisher 线性判别式、Rocchio 伪相关反馈和句子级 MaxSim。未经修改地应用于 19 个保留任务和 3 个未见过的编码器系列,单个固定程序可以改善大多数任务,中位数为 $Δ$nDCG@10,获胜率为 $c{\ge}4$ 54% 到 57%,并且编码器系列的增益在发现过程中从未见过。在相同任务上训练的匹配预算学习投影头不会以这种方式转移,将域内检索提高 $+0.20$ 到 $+0.25$ nDCG@10,但在每个保留的编码器上都低于基线。因此,小型嵌入模型继承了可用的测试时计算潜力,并且冻结编码器将推理计算转换为检索增益,该检索增益转移到没有每个域标签的新语料库和编码器。