论文

通过一致性训练减少政治操纵

Reducing Political Manipulation with Consistency Training

模型训练强化学习

摘要

大语言模型 (LLM) 在各种敏感背景下表现出系统性的政治偏见。我们发现 LLM 不对称地处理来自对立政治派别的对应主题。我们将这种现象称为隐蔽的政治偏见,并确定了其运作的 7 类技术。我们提出了两个衡量隐性偏见的指标:情绪一致性衡量配对政治提示中修辞和框架的对称性;有用性一致性衡量对称深度和参与度。为了减少这两种类型的隐性偏见,我们引入了政治一致性训练(PCT),这是一种具有两种互补范式的强化学习方法:情感一致性训练和帮助性一致性训练。我们证明 PCT 保留了整体的帮助性,大大减少了隐蔽的政治偏见,并推广到了坚持的基准。我们在 https://political-manipulation.ai 发布我们的工作