论文

利用认知能力画像评估AI对职场任务的适配度

Using profiles of cognitive capability to assess AI suitability for workplace tasks

模型评测评测方法与指标

摘要

部署AI的组织面临一个范围界定问题:哪些任务可以自动化,哪些应留给人来做,哪些最好由双方分担。总体基准分数对系统在实践中会在何处成功或失败提供的洞见有限,而人对模型能力的主观判断又会很快过时。我们引入一条流水线,用一组共享的核心认知能力为智能体和任务建立画像。认知能力画像从一组基准测试的成绩推断智能体的能力,其中每道题都标注了其认知需求。任务需求加权则从领域专家那里引出这些相同能力对其工作的相对重要性。由于两者使用同一套认知维度,可以随模型和岗位变化独立更新,并组合起来在领域、组织、岗位或单项职责层面估计AI适配度。我们在合成智能体上验证能力恢复,对六个AI系统建立画像,并向六个职业领域的410名员工引出任务需求。AI系统在认知维度上的差异大于模型家族之间的差异,而职场活动则收敛于一个共同的认知核心。由此得到的分数提供了一个比较性范围界定工具,可用于识别值得试点的候选任务以及当前系统可能不适应的领域。我们讨论了将该框架扩展到对人类工作者与AI系统同时画像,从AI适配度走向人机任务分配。

利用认知能力画像评估AI对职场任务的适配度:论文配图
图1:评估任务适配性的流程包括:(1) 为若干选定的智能体生成认知能力画像,(2) 按相对重要性对目标职场任务的认知需求进行加权,(3) 将能力画像映射到相对重要性矩阵。为简化起见,我们只纳入了两个候选 AI 智能体,但原则上也可以为人类以及人+AI 配对生成可比的能力画像。