论文
重新思考LLM的心理测量评估:自报告何时及为何预测行为
Rethinking Psychometric Evaluation of LLMs: When and Why Self-Reports Predict Behavior
摘要
通过低成本心理测量探针预测大语言模型的行为倾向对于安全部署至关重要,但前提是自我报告 (SR) 能够可靠地预测行为。最近的研究记录了大语言模型中存在大量的 SR 行为分离,但依赖于广泛的人格特征(Big 5),这些特征对特定行为的预测能力很弱,即使在人类中也是如此。此外,会话会话的隔离与弱上下文匹配相结合,使得大语言模型是否真正缺乏连贯性,或者是否未满足检测这种连贯性所需的条件,留下了悬念。我们将“大五人格”与计划行为理论 (TPB) 进行对比,后者衡量针对特定行为的意图,并比广泛特征更好地预测人类行为。我们对 4 个行为任务和 11 个前沿大语言模型进行了实验,同时还改变了会话背景和身份诱导。我们发现 SR 行为一致性是存在的,但是是有选择性的。 1)在共享对话中,计划行为理论达到了人类水平的连贯性; 大五人格则没有。 2)在单独的对话中,只有在直接提示之外的行为中,连贯性才能存在,例如由训练形成的隐性偏见,而当行为受到上下文的强烈影响时,例如阿谀奉承,连贯性就会崩溃。 3) 角色提示使自我报告在对话中更加一致,但不会使行为保持一致。这些发现表明,粗略的个性框架(例如 Big 5)可能不是测试部署行为的最佳工具。需要更多特定于任务和行为的工具,甚至这些工具也必须跨任务和上下文进行评估。
