论文

HEART-Bench:LLM 智能体表现出类人心理吗?

HEART-Bench: Do LLM Agents Exhibit Human-like Psychology?

模型评测基准与评测资源

摘要

虽然 LLM 智能体表现出了卓越的以任务为导向的能力,例如计划、推理和行动,但很少有作品将它们视为完整的人类人格,其中情感维度同等重要。在本文中,我们引入了一种新颖的基准来系统地评估 LLM 智能体是否可以模拟连贯的、类人的心理。具体来说,我们的基准构建了 11 个基于正交大五人格特征的不同人类角色,每个角色都与 1,000 个分布在以理论为基础的发展生命阶段的结构化自传式情景记忆深度结合。为了严格评估 LLM 的心理表现,我们设计了一套包含 64 个决策场景的精选套件,以 DIAMONDS 分类法为指导,这是一个心理框架,从八个维度描述情况:责任、智力、逆境、交配、积极性、消极性、欺骗和社交性。通过让智能体经历不同的场景,该基准评估他们是否能够巩固其先天的人格特征和自传体记忆,以做出与其特定心理特征相一致的行为决策。经过系统的人工验证和筛选后,我们获得了由 673 个多项选择题 (MCQ) 组成的基准。我们相信这个基准测试提供了一个原则性的、可扩展的测试平台,用于研究基于 LLM 的代理的类人情感、个性一致性和价值一致的行为决策。