论文

语义候选人-工作匹配:混合检索中密集嵌入模型的比较评估

Semantic Candidate-Job Matching: A Comparative Evaluation of Dense Embedding Models in Hybrid Retrieval

模型评测模型能力评测

摘要

本文对大容量人员配置工作流程中用于语义候选人职位匹配的密集嵌入模型进行了比较评估。通过基于 LLM 的解析,传入的职位描述将转换为结构化英语搜索文本和特定于语言的关键字,候选人资料将被索引为语义丰富的简历表示形式。我们在统一的混合检索管道中评估 EmbeddingGemma(基础),并与使用缓存多重负排序损失 (MNRL) 进行微调的 EmbeddingGemma 进行比较,该管道通过倒数排名融合 (RRF) 融合向量相似性和全文相关性,并在通过部署的职位候选人匹配评分管道评分的批量比较评估数据集上针对 MPNet 模型对两者进行基准测试。我们进一步用数学细节记录了模型开发过程中考虑的更广泛的对比微调目标(包括 AnglE/CoSENT 式细化)以及保留 Cached-MNRL-only 适应作为首选配置的经验原理。为了支持可重复的模型选择,我们定义了一个更广泛的评估框架,包括精确混合检索协议下的标准信息检索指标(Recall@K,平均倒数排名,nDCG);本文报告的评估使用的指标是微调收敛诊断和使用部署的 AI-Match 分数和独立的 LLM-as-a-Judge 相关性分数进行批量比较评估,我们明确说明了这一范围,而不是暗示测量了完整的框架。该论文解决了通用嵌入基准与企业职位候选人匹配约束之间的差距,为在实际职位候选人检索条件下比较嵌入策略提供了结构化基础。