论文
ORQA:大语言模型专业知识的职业现实问答框架
ORQA: An Occupation-Realistic Question and Answer Framework for LLM Professional Knowledge
摘要
我们提出了 ORQA,一种在大型语言模型中测试职业水平知识的方法。先前的方法要么通过任务定义将抽象的大语言模型技能映射到职业,要么利用难以大规模获得且昂贵的专家知识。 ORQA 通过将 O*NET 职业连接到受信任的职业特定网站(例如监管机构、许可机构、专业组织和政府出版物)并将其转换为可来源追踪的问题答案对,对这两种方法进行了补充。自动化管道和人工审核的结合产生了一系列有关职业的高质量问题。通过我们的方法创建的问题集涵盖了 SOC 中所有 21 个主要群体的 116 个职业,其中 480 个问题来自 187 个不同的网站。每个问题都旨在探讨与相关职业相关的现实技能问题。我们通过这种方法测试了 15 个最先进的前沿模型和开放权重模型。 Claude Opus 4.6、GPT-5.4 和 Claude Sonnet 4.6 均表现最佳,约为 58-62%,而较小的开放式重量模型的性能约为 33-41%。不同职业的表现差异很大。医疗保健相关职业的绩效最高 (78%),而办公室和行政支持的绩效约为 40%。个人职业(例如钣金工人、鱼类和狩猎管理员)的绩效基本上为零。我们还发现开放式问题和工资单加权不会显着影响模型在该基准上的排名。我们相信,利用现有的可信职业特定信息来测试专业领域的大语言模型知识可能是评估未来职业级人工智能表现的一种可扩展且有用的方法。结果和数据可在 orqabench.org 上获取。