论文
大语言模型 中对抗性政治偏见的推理时间缓解
Inference-Time Mitigation of Adversarial Political Bias in Large Language Models
摘要
随着 大语言模型 (LLM) 成为信息检索和摘要任务的中流砥柱,确保它们始终无党派且不受政治偏见影响是迈向更安全、更值得信赖的人工智能 (AI) 的关键一步。当前的模型对齐范例,例如来自人类反馈的强化学习 (RLHF),使 LLM 遵循总体安全说明。然而,这种指令调整可以通过对抗性提示注入来利用,并用于生成不安全的内容。特别是,现代对齐技术并未将政治偏见作为有害和有偏见的内容专门针对。为了解决 LLM 的此漏洞,我们提出了使用思想链 (CoT) 提示和直接偏好优化 (DPO) 的缓解策略。使用立法视频的公共数据集,我们使用 LLM 生成摘要,通过对抗性提示注入偏见,并在专为政治摘要设计的四轴量表上评估其表现。在本文中,我们提出了不同的方法来保护 LLM 免受政治偏见的注入。我们的结果表明,所提出的递归自校正方法将模型性能从政治中立李克特量表基线 2.14 提高到 4.56(所有模型的平均值),证明了 LLM 生成的摘要中政治偏见的有效推理时缓解。