论文

Mira-Embeddings-V1:通过 LLM 合成数据对招聘进行领域适应语义重新排名

Mira-Embeddings-V1: Domain-Adapted Semantic Reranking for Recruitment via LLM-Synthesized Data

模型训练合成数据

摘要

招聘人员的候选人搜寻最好被视为一个两阶段的检索和重新排名管道,在有限的审查预算下,召回是主要目标。上游生产 检索器 首先返回每个职位描述 (JD) 的候选人候选名单,我们的目标是重新排列该候选名单,以便合格的候选人出现在尽可能靠前的位置。我们提出了 mira-embeddings-v1,这是一种用于招聘领域的语义重排序系统,它使用 LLM 合成的训练数据重塑嵌入空间,并使用轻量级重排序头纠正边界混乱。从真实的 JD 开始,我们构建了一个五阶段的提示管道来生成多样化的正样本和硬负样本,从多个角度塑造语义空间。然后,我们应用两轮 LoRA 适应:JD--JD 对比训练,然后在异构文本数据集上进行 JD--CV 三元组对齐。重要的是,这些收益不需要大规模手动标记的工业训练对:一组适度的真实 JD 通过 LLM 综合扩展到监督。最后,BoundaryHead MLP 对 Top-K 结果重新排序,以区分具有相同标题但范围不同的角色。在包含来自上游生产 检索器 的候选者的 300 名真实 JD 的本地池中,mira-embeddings-v1 将 Recall@50 从 68.89%(基线)提高到 77.55%,同时将 Precision@10 从 35.77% 提高到 39.62%。在根据 Qwen3-32B 评分标准评判的超过 44,138 名候选人的支持性全球池中,它的 Recall@200 为 0.7047,而基线为 0.5969。这些结果表明,具有边界感知重排序的 LLM 综合监督无需大量交叉编码器即可产生强大的增益。