论文

发现人类与LLM之间策略行为的差异

Discovering Differences in Strategic Behavior Between Humans and LLMs

模型评测模型行为与机制分析

摘要

随着大语言模型(Large Language Model,LLM)日益被部署于社会与策略场景,理解其行为在何处以及为何与人类行为产生分歧变得至关重要。尽管行为博弈论(Behavioral Game Theory,BGT)为分析行为提供了框架,但现有模型既不能充分刻画人类的特有行为,也不能充分刻画 LLM 这类黑箱非人类智能体的行为。我们采用 AlphaEvolve 这一前沿程序发现工具,从数据中直接发现人类与 LLM 行为的可解释模型,从而实现对驱动人类与 LLM 行为的结构性因素的开放式发现。我们对迭代石头剪刀布的分析表明,前沿 LLM 有能力表现出比人类更深层的策略行为。这些结果为理解策略交互中驱动人类与 LLM 行为差异的结构性因素奠定了基础。

发现人类与LLM之间策略行为的差异
图1:AlphaEvolve所发现程序的图示。图中展示了AlphaEvolve在迭代石头剪刀布上发现的、对人类(左)与Gemini 2.5 Pro(右)而言最简单却最优的程序。为简洁起见,每个程序的可学习参数θ均省略未画。两个程序都使用基于值的学习与对手建模。Gemini 2.5 Pro的程序展现出比人类更精细的对手建模,并在值更新时考虑反事实结果。