论文
衡量和减轻人工智能写作辅助的角色扭曲
Measuring and Mitigating Persona Distortions from AI Writing Assistance
摘要
数亿人使用人工智能 (AI) 来辅助写作。在这里,我们评估了人工智能写作辅助如何扭曲作家角色——他们的感知信仰、个性和身份。在三项大规模实验中,作家(N=2,939)在有或没有人工智能辅助的情况下撰写了政治观点段落。不同的读者群体 (N=11,091) 在读者感知的 29 个社会显着维度上盲目评估这些段落,涵盖政治观点、写作质量、作者个性、情感和人口统计数据。人工智能写作辅助在各个方面都产生了人物角色扭曲:有了人工智能,作家似乎更加固执己见、更有能力、更积极,他们的人口统计资料也转向了更有特权的群体。作家们反对许多观察到的扭曲,但即使意识到这些扭曲,他们仍然更喜欢人工智能辅助的文本。我们通过在实验数据(10,008 个段落,2,903,596 个评分)上训练奖励模型,成功地减轻了模型层面令人反感的角色扭曲,以引导 AI 输出忠实地表达作者立场。然而,这是以用户接受度为代价的,这表明人工智能写作辅助的理想和不良特性之间可能难以解决。在两项后续研究(N=8,798)中,当人工智能的扭曲性更强时,读者对人工智能辅助作家的信任度大大提高,并且更容易被人工智能写作所说服。总之,我们的研究结果表明,即使在人类监督的现实条件下,人工智能写作辅助造成的人物角色扭曲也普遍存在且持续存在,并且它们可能对人类的行为和态度产生重大影响,这对随着人工智能采用而扩大的公共话语、信任和民主审议产生影响。