论文

从词汇基线到Agentic RAG:用SFIA提取结构化技能与责任层级

From Lexical Baselines to Agentic Retrieval-Augmented Generation: Structured Skill and Responsibility-Level Extraction with the SFIA Framework

模型评测模型能力评测

摘要

自动技能提取支撑着劳动力规划,但大多数系统将技能表示为平面标签,而没有实践技能的责任级别的概念。信息时代技能框架 (SFIA) 正是抓住了这一维度,定义了跨七个责任级别的 147 项专业技能,但尚未报道针对 SFIA 的基于 LLM 的自动提取。我们将任务形式化为来自自由文本的(技能、水平)对的结构化预测,并提出三个问题:文本映射到 SFIA 封闭词汇表的准确度如何,哪些策略可以可靠地预测技能水平,以及 Agentic 设计是否在更简单的检索和提示方面有所改进?我们根据专家映射的欧洲 ICT 角色概况评估了五种策略(词汇基线、带有 LLM 重新排名的密集检索、零样本模式约束的 LLM、单Agent Agentic RAG 和三Agent检索器 - 匹配器 - 验证器组),所有策略都利用了由我们发布的全自动 Agentic 管道构建的 SFIA~9 语料库。基于检索的匹配可以识别最多的技能,而生成策略则明显更加精确;只有将级别指定为明确决策的策略才能可靠地预测它,而基于相似性的选择的不准确率要高出两倍以上;而且工作人员会在不提高准确性的情况下使延迟加倍,因此增加的Agent角色不会自动有利于封闭分类匹配。这些结果为针对 SFIA 的结构化、水平感知技能提取提供了第一个可重复的基线。