论文

大语言模型 中的事实意见可以编辑(操纵)吗?

Can Factual Opinions Be Edited (Manipulated) in Large Language Models?

模型训练模型编辑与遗忘

摘要

大语言模型 (LLM) 越来越多地融入各个领域,使得知识编辑技术变得至关重要但存在潜在危险。当前的编辑方法主要针对原子事实,忽视了与操纵事实观点相关的重大风险,例如公众人物对社会问题的立场记录。这种操纵可能会重塑公众形象、影响选举并改变社会观点。为了系统地评估这一威胁,我们引入了事实意见编辑证据 (FOE) 基准,其中包含 261 名公众人物、19 个问题类别和 2,178 条完整意见记录。我们的评估表明,当前的编辑技术与事实观点存在很大的矛盾,通常只能实现表面的改变,而无法保持编辑观点与模型生成的支持证据之间的一致性。为了解决这个限制,我们进一步提出了一种简单而有效的自生成证据对齐方法,该方法无需依赖显式指令即可实现意见-证据对齐。我们的基准和方法共同为理解 LLM 中事实意见编辑的新兴安全影响奠定了基础。