论文
评估语言模型的有害操纵
Evaluating Language Models for Harmful Manipulation
摘要
对AI驱动的有害操纵这一概念的兴趣日益增长,但目前评估它的方法有限。本文提出一个通过情境特定的人机交互研究来评估有害AI操纵的框架。我们通过一项有10,101名参与者参与的AI模型评估来展示该框架的效用,涵盖三个AI使用领域(公共政策、金融和健康)和三个地区(美国、英国和印度)的交互。总体而言,我们发现被测模型在被提示时能够产生操纵行为,并且在实验环境中能够诱导参与者的信念和行为改变。我们进一步发现情境很重要:AI操纵在领域之间存在差异,这表明需要在AI系统可能被使用的高风险情境中对其进行评估。我们还发现测试地区之间存在显著差异,这表明来自某一地区的AI操纵结果可能无法推广到其他地区。最后,我们发现AI模型操纵行为的频率(倾向性)并不能一致地预测操纵成功的可能性(效力),这凸显了分别研究这两个维度的重要性。为促进评估框架的采用,我们详细说明了测试协议并公开了相关材料。最后我们讨论了评估AI模型有害操纵的开放性挑战。
