论文
从权重到单词:用自然语言表达和编辑偏好模型推论
From Weights to Words: Expressing and Editing Preference Model Inferences in Natural Language
摘要
越来越多地使用统计学习算法从高维选择数据推断人类偏好,但遇到了一个根本性的挑战:选择方案通常同时在许多方面有所不同,因此通常不清楚哪些因素实际上驱动了观察到的决策,并应将其视为偏好。使这个问题更加复杂的是,这些方法的不透明性使得人类操作员在模型出错时无法检查、质疑或纠正模型。我们引入了 \emph{词权重},这种方法将选择问题的数据集作为输入,并自动发现与领域相关的偏好维度的集合,每个维度都用自然语言描述,并与模型表示空间中的向量配对。这些维度解决了不确定性和不透明性问题:它们可以用于将归因集中在一小组有意义的因素上,并且可以用自然语言将模型的推论具体化,以便用户可以实时检查和编辑它们。我们首先定性地说明了该方法在四个不同领域的多功能性:道德困境、电影、葡萄酒和自由形式的 LLM 响应。然后,我们报告了两个预先注册的人类受试者实验,关于道德困境($N=450$)和电影选择($N=449$),这些实验证明了其对学习偏好模型的好处:(1)根据学习的基础规范化偏好模型可以提高对保留选择的预测准确性,(2)结合参与者的结构化编辑进一步提高准确性。在面对面的比较中,参与者更喜欢该方法推断的偏好概况,并认可其预测更准确。