论文

macro2mind:从宏观信号学习个体行为模拟

Learning to Simulate Individuals from Macro Social Signals

模型训练强化学习

摘要

大语言模型越来越多地用于模拟个体如何应对新情况,但这些反应背后的行为推理要么是从预训练中继承的,要么是从个人级别的注释中学习的,这些注释提供了有限的行为多样性,并且对推理本身的监督很少。我们建议从预测市场中学习行为推理,其价格轨迹记录了人们如何大规模应对现实世界事件。我们引入了 Macro2mind,它使用市场信号通过 GRPO 训练语言模型。社会行为分解使行为推理成为预测的明确步骤:模型推断市场参与者的代表性群体,预测每个人如何解释新闻并更新其信念,解释他们的互动,并将这些反应汇总为价格。具有困难意识抽样的事后后悔课程将训练的重点放在事后确定的群体显着改善预测的转变上,同时优先考虑当前策略仍然可学习的示例。学到的推理适用于用户模拟,无需进一步训练。在 SWM-Bench 上,macro2mind 在 Polymarket 上实现了最先进的方向准确性和相关性。它根据市场数据进行训练,将零样本转移到四个用户模拟基准(Humanual、OvertonBench、PRISM 和 CAD),并且在零样本方法中具有具有竞争力的性能。作为数据生成器,macro2mind 还将下游模拟器对未见过的用户的准确度提高了 15.5 点,比 骨干模型 生成的数据高出 13.2 点。

macro2mind:从宏观信号学习个体行为模拟:论文原图
图 2:macro2mind 的流程,以运行示例进行说明。 (a) 从哪里学习:遗憾与困难课程通过关注高度遗憾的转变来进行数据选择,例如通胀数据低于预期后的价格上涨,同时忽略噪音。 (b) 如何推理:通过社会行为分解,模型推断不同群体对新闻(一阶)以及彼此之间(二阶)的反应,并将他们的信念更新汇总为由已实现价格奖励的预测。 (c) 零样本迁移:这种学习到的推理能力被零样本迁移到用户模拟,有效地模拟个人(例如小企业主)对 CPI 新闻和同行评论的反应。