论文

解释和指导 LLM 代理进行社交模拟

Interpreting and Steering LLM Agents for Social Simulations

模型评测模型行为与机制分析

摘要

事实证明,基于大型语言模型 (LLM) 的模拟对于理解人类行为非常有效,使其成为社会科学工具包的宝贵补充。然而,大语言模型最终是基于深度神经网络的黑匣子,这限制了它们对社会科学的价值。这是因为缺乏(i)可解释性:即分配驱动观察到的行为的清晰机制的能力;缺乏(ii)可操纵性:即抑制或放大特定的理论上有意义的作用机制以驱动特定模型行为的能力。在这里,我们演示了如何打开黑匣子以进一步丰富基于 LLM 的模拟。具体来说,我们比较了三种类型的方法:(1) 基于提示的操作,(2) SAE 衍生的特征引导,以及 (3) 基于探测的方向引导,并检查它们在基于 LLM 的社会科学模拟中的实用性。我们通过解释和引导人类行为的两个基本组成部分,即偏好(风险态度、利他主义)和能力(发散创造力、产品创新)来实现这一点,并使用作为自然语言交互实现的四个经典经济和创造性任务来操作。总体而言,我们的结果表明,基于 SAE 和探测的技术在指导 LLM 代理方面通常优于基于基本提示的方法,尽管这种优势取决于所涉及的具体提示策略。 SAE 和探针共同构成了社会科学家在社会模拟中解释和引导智能体的有效管道:SAE 将智能体的内部表征分解为人类可读的特征,之后探针可以可靠地将智能体的行为转向指定的方向。我们讨论这些方法对未来使用 LLM 代理进行社会科学模拟的工作的影响。