论文
JobHop v2:来自非结构化简历的大规模职业轨迹数据集
JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes
摘要
大规模、注释丰富的职业轨迹数据支撑着劳动力规划、工作推荐和劳动力市场分析,但公开可用的数据集要么很小,无法独立使用,要么是根据 LLM 合成的预标准化职业代码而不是真实的自由文本构建的。我们提出了 JobHop~v2,这是公开的 JobHop 数据集的改进版本,通过从佛兰德公共就业服务 VDAB 提供的 ${\sim}440{,}000$ 假名多语言简历的语料库中端到端提取 大语言模型 (LLM) 构建而成。发布的数据集包含 $355{,}315$ 的职业轨迹,用 ESCO 职业代码、四分之一级别的时间信息和标准化的五级教育程度进行注释,扩大了原始版本的覆盖范围和注释丰富度。相对于 v1,JobHop~v2 引入了基于推理控制的 LLM 推理的重新设计的提取管道,具有重试机制(实现 100% JSON 解析率)、更丰富的提取模式以及针对三个互补注释基线进行评分的修订评估协议。根据这些基线进行评估,我们最好的提取器在所有比较模型中最接近注释器间一致性上限,仅落后 1.1-2.7 个百分点。公开发布数据集和代码以支持可重复的职业轨迹研究。