论文

用认知模型改进语言模型对人类说服博弈的仿真

Using Cognitive Models to Improve Language Model Simulation of Human Persuasion Games

模型训练强化学习

摘要

人们在策略互动中的决策方式各异:有的像贝叶斯主义者那样更新信念——有的表现出动机性推理等偏差。虽然大语言模型的创造者使用仿真人类做安全评估与训练——但常未覆盖人类行为的这种广度。我们主张认知科学与经济学为此提供便利工具——利用人类决策的数学模型。我们提出称为方程到行为提示的方法——引导大语言模型匹配认知模型——并在基于法律决策的说服博弈上评估该方法。我们发现:大模型可经提示近似基于方程的规格——贝叶斯更新、仿射扭曲、动机更新与Grether的α-β模型——但小模型无法做到。然而——以强化学习训练小模型遵循数学规则(方程到行为RL)在分布外参数化下把信念误差降低26.5%。我们表明这些仿真可帮助创建多样训练环境:训练小模型考虑不同类型决策者——较仅贝叶斯训练改进平均信念变化2.5%-12%——即便在说服GPT-5-mini时亦然。我们的工作可改进日益现实设定中用于训练与评估的人类仿真——并开启对更复杂人类决策数学模型的新研究。

用认知模型改进语言模型对人类说服博弈的仿真:论文配图
图 1:方程到行为方法的概述。我们使用人类决策的认知模型为语言模型代理提供行为规范,从而在战略交互中实现现实决策者的可控模拟。