论文

每个词元都很重要:用于测量 LLM 态度和偏见的精确李克特量表分布

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

模型评测评测方法与指标

摘要

随着 大语言模型 (LLM) 越来越多地部署为自主代理,准确评估其潜在值和偏差至关重要。 NLP 社区通常使用大型非结构化基准来评估模型。虽然这些数据集对一般能力有效,但从根本上混淆了因果机制:即使检测到总体偏差,非结构化评估也无法区分它是否源于基线特征、上下文混杂因素或复杂的相互作用。为了解决这个问题,我们引入了一个用于 LLM 受控行为评估的精确分析框架。我们通过解决设计、测量和分析方面的差距,将人类心理测量学与 LLM 力学联系起来。首先,我们用完全交叉的因子实验取代非结构化提示,以系统地分离因果效应和交互效应。其次,我们通过直接对精确的 词元级 概率质量函数 (PMF) 进行操作来消除蒙特卡罗文本采样噪声。第三,我们推导了一个多元序数一致度量和一个分布方差分析来分析处理这些 PMF。我们通过五个 LLM 的消费者种族中心主义案例研究来验证我们的框架,展示我们的方法如何隔离系统性原产国偏见,这些偏见汇总基准否则会变得模糊。