论文
内核仿射外壳机作为冻结语义空间的计算高效编码器
Kernel Affine Hull Machines as Compute-Efficient Encoders for Frozen Semantic Spaces
摘要
基于 Transformer 的语义编码器对于检索非常有效,但在许多部署中,反复出现的瓶颈是在线查询编码而不是离线语料库索引。本文研究了一旦固定了强大的教师表示空间和语料库索引,重复的神经查询编码是否可以被更轻且分析明确的估计器取代。我们将固定教师词汇到语义编码表述为条件均值估计问题,其中目标语义向量表示为由后验聚类概率加权的语义原型的噪声混合。内核仿射赫尔机(KAHM)几何用于根据明确识别的 RKHS 假设空间中廉价的词汇特征来估计这些后验权重,并且通过来自噪声教师嵌入的归一化最小均方更新来细化语义原型。这产生了一个无反向传播的查询端编码器,以及将端到端误差分解为后验近似、有限样本/泛化和教师噪声项。我们在受控的奥地利法检索基准上实例化了该方法,其中包含 5,000 个测试查询、84 个候选法则和 10,762 个对齐的检索单元,使用特定于法则的编码器进入冻结的 Mixedbread 嵌入空间。在评估匹配的学习适配器中,KAHM 在所有评估的截止点上实现了最强的教师空间重建和最佳的排名敏感检索性能。在 k=20 时,它获得 MRR@20 = 0.504、Hit@20 = 0.694 和 Top-1 Accuracy = 0.411,同时相对于报告的 CPU 设置中的直接 Transformer 查询编码,将每个查询的在线时间减少 8.53。结果支持 KAHM 作为有监督固定表示部署机制的计算高效编码器。