论文
ActTraitBench:通过人性化行为验证量化 大语言模型 中的知识决策差距
ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation
摘要
虽然 大语言模型 (LLM) 可以令人信服地模拟显式自我报告中的人物角色,但它们经常在隐性行为决策中出现偏差,揭示出巨大的知识决策差距 ($G_{\mathrm{KD}}$)。由于基于 LLM 的评估中有限的构造有效性、多维纠缠和分布偏差,现有基准很难衡量这种差异。为了解决这些问题,我们提出了 ActTraitBench,一个以人为本的评估框架,用于测量 LLM 中的人格一致性。 ActTraitBench 以人类经验数据为基础,在心理测量方面和行为范式之间建立一对一的映射,并通过分位数映射应用分布校准,以减少 LLM 判断分数和人类反应之间的分布不匹配。对 14 个主流 LLM 进行的实验揭示了巨大的知识决策差距,并表明对于大多数评估模型来说,分配的角色在自我报告中比在行为决策中反映得更一致。为了缩小这一差距,我们进一步引入了认知对齐链(CoCA),这是一种推理时间干预,可以减少 13 个模型中 12 个具有配对结果的 $G_{\mathrm{KD}}$ 。代码和资源可在 https://github.com/Selina233/ActTraitBench 获取。