论文
使用综合查询探测映射嵌入模型之间的相似性空间
Mapping Similarity Spaces across Embedding Models with Synthetic Query Probing
摘要
检索增强生成系统依靠相似性分数来检索相关内容,但由于不同的几何属性、复杂的模型迁移和限制阈值重用,因此分数在嵌入模型之间无法直接比较。我们研究如何通过学习分数分布之间的映射而不是嵌入来关联相似性分数。我们引入了综合查询探测,从文档生成查询以创建受控的查询块对,从而实现跨模型相似行为的大规模、无参考分析。我们评估了多种嵌入配置的方法,并使用线性、等渗和分位数映射学习分数转换函数。 SciFact 和专有语料库的实验表明,虽然模型在排名上基本一致,但它们的绝对分数表现出系统性扭曲。学习映射部分对齐这些空间并提高阈值可移植性,其中等渗回归表现最佳。我们的结果强调了跨模型校准的必要性,并将综合查询探测定位为分析嵌入可比性的可扩展框架。