论文
人类认知与行为的小型基础模型
Small Foundation Models of Human Cognition and Behaviour
摘要
大语言模型在人类行为数据上进行微调后,已成为通用认知代理。然而,这种规模要求以及这些模型是否处理任务结构或利用统计捷径的问题仍不清楚。我们训练了十四个模型,参数从135M到14B,跨越四个架构家族,在Psych-101上,这是一个包含1,070万次试次级选择的160项实验数据集。在分布的情况下,规模几乎无关紧要。这些模型落在一个狭窄的范围内,就像受到天花板限制一样,0. 6B到1B参数足以匹配基准模型(70B)在留出的参与者上的表现。在分布之外的情况下,这个范围变得更加陡峭,更大的模型在处理新颖的任务结构方面明显更有优势。为了确定这些模型使用了什么信息,我们运行了两个诊断工具。我们在27个实验中逐步剥离四个提示通道——任务说明、实验刺激、结果反馈和选择历史——并随机化试验顺序。遮盖刺激内容和反馈会破坏75. 7%的学习信息,并使模型低于随机水平,表明仅选择历史无法解释性能。随机化揭示了独立试验的任务不变性,但在由先前的响应确定试验顺序的情况下,敏感性。因此,小规模认知微调模型在心理实验中展示出潜力作为噪声天花板估计器,尽管其范围受到训练数据中看到的范式的限制。
