论文

AI 技能转变:绘制 LLM 时代的技能过时、出现和过渡路径

The AI Skills Shift: Mapping Skill Obsolescence, Emergence, and Transition Pathways in the LLM Era

模型评测模型能力评测

摘要

随着 大语言模型 重塑全球劳动力市场,政策制定者和工人需要有关职业技能最容易受到自动化影响的经验数据。我们提出技能自动化可行性指数 (SAFI),对四个前沿 LLM(LLaMA 3.3 70B、Mistral Large、Qwen 2.5 72B 和 Gemini 2.5 Flash)进行基准测试,涵盖美国劳工部 O*NET 分类法中所有 35 项技能的 263 个基于文本的任务(模型调用总数为 1,052 个,失败率为 0%)。通过与人类经济指数(756 个职业、17,998 项任务)中的现实世界人工智能采用数据进行交叉参考,我们提出了一个人工智能影响矩阵——一个将技能定位在四个象限的解释框架:高置换风险、需要提升技能、人工智能增强和低置换风险。主要发现:(1)数学(SAFI:73.2)和编程(71.8)获得最高的自动化可行性得分;主动听力(42.2)和阅读理解(45.5)得分最低; (2)“能力需求倒置”,其中人工智能工作中最需要的技能是 LLM 在我们的基准测试中表现最差的技能; (3) 78.7% 观察到的人工智能交互是增强,而不是自动化; (4) 所有四个模型都收敛到相似的技能概况(3.6 点分布),这表明基于文本的自动化可行性可能比模型更依赖于技能。 SAFI 根据基于文本的技能表示来衡量 LLM 表现,而不是完整的职业执行力。所有数据、代码和模型响应都是开源的。