论文

冷启动候选排名的单词元期望值评分

Single-Token Expected-Value Scoring for Cold-Start Candidate Ranking

模型推理解码与生成控制

摘要

人工智能辅助采购简化了候选人审核,减轻了招聘人员手动筛选的管理负担。然而,将语言模型部署为生产排名器仍然具有挑战性。零样本大型语言模型 (LLM) 可能会产生不稳定、不确定的分数,并且排名不太准确,而传统的深度神经排名器需要数以百万计的记录交互,而低流量、利基采购平台无法产生这些交互。相反,可用的是几十万个序数相关标签——按照排序器训练标准来说很小,但当预训练的语言模型已经编码了任务所依赖的一般世界知识时就足够了。我们提出了单标记期望值评分,这是一种排名原语,它将候选人与工作的相关性转换为等级标记 {1, ..., 5} 上的顺序分类,并将相关性分数读取为第一个标记概率分布的期望。由于分数来自单个解码步骤而不是开放式生成,因此它是模型 logits 的确定性函数,不需要输出解析,并且服务延迟较低。为了仅从这种监督中了解异构招聘标准的非线性相互依赖性,我们对小语言模型(SLM)进行了微调,该模型具有混合序数回归损失,结合均方误差项(保留序数距离)和分类交叉熵项(锐化类别边界)。我们使用 NDCG@10 和低相关率从两个维度进行评估——求职者相关性和雇主相关性。离线时,我们经过微调的模型优于启发式基线和零样本大语言模型。端到端模拟显示了更大程度的相同方向(+54.2% 求职者 NDCG@10,-46.7% 低相关率),实时在线实验将雇主低相关性降低了 27.3%,并将雇主保留率提高了 7.07%。