论文
大语言模型 能否超越行为模仿来模拟人类认知?
Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?
摘要
人工智能的一个重要问题是LLM是否可以模拟人类认知或仅仅模仿表面行为,而现有数据集要么受到合成推理痕迹的影响,要么受到群体层面聚合的影响,无法捕捉真实的个体认知模式。我们引入了一个基于人工智能不同领域 217 名研究人员的纵向研究轨迹的基准,其中每位作者的科学出版物作为其认知过程的外化表示。为了区分 LLM 是转移认知模式还是仅仅模仿行为,我们的基准故意采用跨域、时间转移泛化设置。进一步提出了多维认知一致性度量来评估个体水平的认知一致性。通过对最先进的LLM和各种增强技术的系统评估,我们对以下问题进行了第一阶段的实证研究:(1)当前的LLM模拟人类认知的效果如何? (2) 现有技术可以在多大程度上增强这些能力?