论文

AI心理测量学:以心理测量效度评估大语言模型的心理推理

AI Psychometrics: Evaluating the Psychological Reasoning of Large Language Models with Psychometric Validities

模型评测模型能力评测

摘要

海量参数与深度神经网络使大语言模型(LLM)的复杂度可与人类大脑匹敌,这也使其成为难以评估与解释的不透明「黑箱」系统。AI心理测量学是一个新兴领域,旨在把心理测量学方法应用于评估与解释人工智能(AI)系统的心理特质与过程。本文研究以AI心理测量学评估四个知名LLM——GPT-3.5、GPT-4、LLaMA-2与LLaMA-3——的心理推理与整体心理测量效度。我们以技术接受模型(TAM)为框架,考察各模型的聚合效度、区分效度、预测效度与外部效度。发现显示所有模型的响应总体满足全部效度标准;且更强的模型(GPT-4与LLaMA-3)一致展现出优于前代(GPT-3.5与LLaMA-2)的心理测量效度。这些结果有助于确立以AI心理测量学评估解释大语言模型的有效性。

AI心理测量学:以心理测量效度评估大语言模型的心理推理:论文配图
图1:技术接受模型(TAM)结构示意图,论文借心理测量模型评估LLM的心理推理能力。