论文

后训练 使 大语言模型 不太像人类

Post-training makes large language models less human-like

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用作人类参与者的替代品,但仍不清楚哪些模型最能捕捉人类行为以及原因。为了解决这个问题,我们引入了 Psych-201,这是一个新颖的数据集,使我们能够大规模测量行为一致性。我们发现 后训练(将基础模型转变为有用助手的阶段)持续降低了模型系列、规模和目标与人类行为的一致性。此外,即使基础模型不断改进,这种错位在新一代模型中也会扩大。最后,我们发现角色归纳——一种通过根据参与者特定信息调节模型来引发类人行为的流行技术——并不能改善个体层面的预测。总而言之,我们的结果表明,目前用于将 LLM 转变为有用助手的过程也使它们对人类行为的模型不太准确。