论文
通过上下文构造与导航改善LLM社会模拟中的行为对齐
Improving Behavioral Alignment in LLM Social Simulations via Context Formation and Navigation
摘要
大语言模型(LLM)日益被用于在实验环境中模拟人类行为,但在复杂的决策环境中,它们与人类决策存在系统性偏离——在这些环境中,参与者必须预判他人的行动并基于观察到的行为形成信念。我们提出一个改善行为对齐的两阶段框架。第一阶段是上下文构造(context formation),明确说明实验设计,以建立对决策任务及其情境的准确表征;第二阶段是上下文导航(context navigation),在该表征内引导推理过程以作出决策。我们通过对带质量信号的序贯购买博弈(Kremer与Debo,2016)的焦点复制验证该框架,并扩展到带成本信号的众筹博弈(Cason等,2025)和一个需求估计任务(Gui与Toubia,2025),以测试其在不同决策环境间的可泛化性。在四个最先进(SOTA)模型(GPT-4o、GPT-5、Claude-4.0-Sonnet-Thinking、DeepSeek-R1)上,我们发现复杂的决策环境需要两个阶段同时作用才能实现与人类基准的行为对齐,而较简单的需求估计任务只需上下文构造。我们的发现厘清了每个阶段何时必要,并为设计与诊断LLM社会模拟——作为行为研究中人类被试的补充——提供了系统方法。
