论文

大语言模型中的奖励评估:快感缺乏的因果归纳

Reward Valuation in Large Language Models: Causal Induction of Anhedonia

模型评测模型行为与机制分析

摘要

最近的前沿模型模仿了人类认知的复杂方面。在这里,我们询问这种一致性是否延伸到奖励评估,我们在机械框架中评估奖励评估。具体来说,我们使用开发的临床测试来评估患有重度抑郁症的人类受试者的快感缺失。从机制上讲,快感缺乏常常与伏隔核(NAc)和更广泛的多巴胺能奖励系统的失调有关。虽然神经影像学已经定位了这些缺陷,但建立 NAc 活性和特定行为症状之间的因果关系仍然是一个挑战。我们利用神经科学的这些想法在功能上识别最先进的人工智能模型中的奖励预期单元,并通过有针对性的扰动评估它们的因果关系。我们发现,此类模型单元不仅可以预测 NAc 大脑记录,它们的扰动还会引发反映人类快感缺乏的行为效应:该模型在基于努力的决策范式中选择低努力、低回报的任务。至关重要的是,我们的结果表明,这代表了以自我为中心的奖励评估和​​预期的特定缺陷,而不是任务能力、奖励计算或努力回避的损失。这种诱发的脆弱性与人类快感缺失和动机的临床测量相一致,例如 DARS 和 MAP-SR,这些工具不包含与奖励相关的词汇,排除了对扰动效应的纯粹词汇解释。综上所述,我们的结果表明人工智能模型中的奖励评估电路在功能上模仿了人类的评估电路。