论文
跨业务学科的前沿人工智能表现:基于案例的知识工作和分析推理基准
Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning
摘要
正如基准分数所反映的,大语言模型 (LLM) 正在迅速提高,但这些 AI 基准主要测试事实回忆、狭义问答、数学问题解决、编码和代理工具使用等能力。仍然缺乏衡量的是人工智能在白领专业人士日常分析知识工作方面的进展,包括综合复杂信息、在不确定和不完整信息下进行判断、在多利益相关者环境中应用战略和对抗性思维、权衡权衡以及进行合理的结构化分析。对于此类工作的主观部分来说,这种差距更加明显,因为成功很难定义。顶尖商学院实行的“案例方法”教育形式为解决这种衡量差距提供了天然的基础,我们构建了 BusinessCaseBench,这是一个涵盖从十八个学科的商业案例中提取的数百个问题的基准,每个问题都配有一个源自专家编写的讲师案例解决方案的评分标准。在 BusinessCaseBench 上,前沿人工智能模型已经根据讲师评分标准获得了很高的评分,并且一个模型系列的能力在两年内大幅提高。这些结果提供了强有力的证据,表明人工智能在此类工作中的表现已经很高,并且正在迅速提高,这对商学院和入门级专业角色都有影响,在商学院中,案例教学法对本科生和 MBA 进行此类分析推理的培训,而对于入门级专业角色来说,此类技能历来是早期职业工作的基础。