论文
教机器价值观:在LLM中模拟类人行为
Teaching Values to Machines: Simulating Human-Like Behavior in LLMs
摘要
大语言模型(LLM)展现出扮演不同人设与角色的出色能力;然而,它们能否表现出符合连贯的、类人价值结构的行为仍不清楚。本工作借鉴成熟的心理学价值理论,在LLM中诱导类人价值观,并评估其与人类研究中所观察模式的吻合程度。借助经过验证的心理学问卷,我们开展了超过500万道题的大规模实验,评估主流LLM的价值结构及价值—行为关系,并将其与人类进行比较。我们的发现显示,在这两个维度上,经价值提示的LLM与人类都表现出高度一致。此外,引入人类价值分布可以增强基于价值诱导LLM的群体级模拟。这些发现凸显了价值诱导LLM作为有效且具有心理学依据的人类行为模拟工具的潜力。
