论文
对政治联盟 大语言模型 的多维审计
A Multi-Dimensional Audit of Politically Aligned Large Language Models
摘要
随着 大语言模型 (LLM) 的应用遍及各个行业,人们越来越担心其滥用的可能性,特别是在政治话语等敏感领域。通过即时工程或 微调 技术,故意将 LLM 与特定的政治意识形态保持一致,在政治运动等用例中可能是有利的,但由于性能下降、错误信息或偏见行为增加的风险增加,需要仔细考虑。在这项工作中,我们提出了一个受哈贝马斯交往行动理论启发的多维框架,以使用自动化的定量指标来审计跨四个维度的政治一致的语言模型:有效性、公平性、真实性和说服力。将其应用于通过 微调 或角色扮演排列的九个流行的 LLM 揭示了一致的权衡:虽然较大的模型往往在角色扮演政治意识形态方面更有效并且在他们的反应中更真实,但它们也不太公平,以对不同意识形态的人的愤怒和有毒语言的形式表现出更高程度的偏见。与相应的角色扮演模型相比,微调模型表现出更低的偏差和更有效的对齐,但也出现了推理任务性能的下降和幻觉的增加。总体而言,所有测试的模型在四个指标中至少有一个表现出一些缺陷,突出表明需要更平衡和稳健的对齐策略。最终,这项工作旨在确保政治一致的 LLM 产生合法、无害的论点,提供一个框架来评估这些模型的负责任的政治联盟。