论文
缩放会改善 LLM 的社交模拟吗?
Will Scaling Improve Social Simulation with LLMs?
摘要
大语言模型 (LLM) 社会模拟是一种很有前途的研究方法,但还不够忠实,无法广泛采用。在这项工作中,我们研究了语言建模中当前的缩放范式是否有可能缩小这些差距,或者模拟保真度是否与一般功能正交,因此值得更多的研究关注。我们使用缩放定律来研究 LLM 的计算规模、通用能力基准和三个代表性子领域的社会模拟保真度之间的关系:意见建模、行为模拟和纵向预测。令人惊讶的是,我们发现在所有三种设置中都具有强大的计算扩展能力,使用一套 85 个 Transformer LLM 以及在 DCLM Web 文本语料库上预先训练的 Qwen3 架构,固定计算预算为 10^{18}$ 到 $10^{20}$ FLOP。然后,我们评估 35 个更大、能力更强的开放权重模型,最多 70B 个参数,使我们能够预测损失的下游准确性。这表明,大多数行为和意见模拟任务将随着规模的扩大而迅速改进,特别是当它们涉及英语网络语料库中具有代表性的人群时。纵向预测和代表性不足的观点扩展得更慢,尤其是当它们与一般知识和推理基准(如 MMLU)相关性较低时。在行为模拟中,缩放无法改善模型校准,因为人类认知偏差(例如风险厌恶)以及人类启发法(例如从相关任务中学习相关奖励)。在这些任务中,即使经过微调的模型也无法将性能从 0.5B 参数显着提升到 8B。综上所述,我们得出的结论是,在大多数情况下,规模将改善社交模拟,但存在异常值,并且在资源匮乏的领域中,改进将不太可靠。