论文
Chinese-SkillSpan:用于从中国招聘广告中提取符合 ESCO 能力的跨度数据集
Chinese-SkillSpan: A Span-Level Dataset for ESCO-Aligned Competency Extraction from Chinese Job Ads
摘要
岗位技能命名实体识别(JobSkillNER)旨在从大规模招聘数据中自动提取关键技能信息,这对于提高人才市场匹配效率、支持个性化就业服务具有重要意义。据我们所知,这项工作提出了第一个中文 JobSkillNER 招聘文本数据集。我们提出了针对中文职位发布的注释指南和 LLM 授权的宏观-微观协作注释管道。该管道利用 大语言模型 (LLM) 的上下文理解能力进行初始注释,然后通过专家句子级裁决来细化结果。使用此管道,我们注释了 2014-2025 年期间从四个主要招聘平台收集的 20,000 多个实例。基于这些努力,我们发布了Chinese-SkillSpan,这是第一个符合ESCO职业技能标准的中国JobSkillNER数据集,涵盖知识、技能、横向能力和语言能力(LSKT)四个维度。实验结果表明,该数据集支持有效的模型训练和评估,表明Chinese-SkillSpan有助于填补中文JobSkillNER资源的重大空白,为智能招聘研究提供有用的基准。代码和数据可在 https://sites.google.com/view/cn-skillspan-resources 获取。