论文

数字叙事:《大语言模型》中的可识别受害者效应及其在对齐和推理下的放大

Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models

模型评测鲁棒性、公平性与可信度评测

摘要

可识别受害者效应 (IVE) $-$ 是指将更多资源分配给特定的、叙述性描述的受害者,而不是分配给面临同等困难的统计特征群体 $-$ 的倾向,这是道德心理学和行为经济学中最有力的发现之一。随着 大语言模型 (LLM) 在人道主义分类、自动拨款评估和内容审核中发挥重要作用,一个关键问题出现了:这些系统是否继承了人类道德推理中存在的情感非理性?我们在 LLM 中首次对 IVE 进行了系统性、大规模的实证研究,包括跨越 9 个组织谱系(Google、Anthropic、OpenAI、Meta、DeepSeek、xAI、阿里巴巴、IBM 和 Moonshot)的 16 个前沿模型的 N=51,955 个经过验证的 API 试验。使用一套十个实验 $-$ 移植和扩展 Small 等人的规范范例。 (2007) 以及 Kogut 和 Ritov (2005) $-$ 我们发现 IVE 很普遍,但受到对齐训练的强烈调节。指令调整模型表现出极端的 IVE(Cohen d 高达 1.56),而推理专用模型则相反(低至 d=-0.85)。汇总效应 (d=0.223, p=2e-6) 大约是 Lee 和 Feeley (2016) 报告的单受害者人类荟萃分析基线 (d$\approx$0.10) $-$ 的两倍,并且可能比整体人类汇总效应更大,因为群体受害者人类效应接近于零。标准思想链 (CoT) 促使 $-$ 与其作为审慎纠正 $-$ 的作用相反,几乎使 IVE 效应大小增加了三倍(从 d=0.15 到 d=0.41),而只有功利主义的 CoT 才能可靠地消除它。我们进一步记录了心理物理麻木、完美数量忽视以及边缘群体内/群体外文化偏见,这对人工智能在人道主义和道德决策环境中的部署产生了影响。