论文
当智能体说服时:大语言模型中的宣传产生和缓解
When Agents Persuade: Propaganda Generation and Mitigation in LLMs
摘要
尽管具有广泛益处,部署在开放环境中的基于LLM的Agent可能被利用来生产操纵性内容。在这项研究中,我们给LLM设定宣传目标,并使用两个领域专用模型分析其输出:一个将文本分类为宣传或非宣传,另一个检测宣传中的修辞技巧(如煽动性语言、诉诸恐惧、挥舞旗帜、扣帽子)。我们的发现表明,在被提示时,LLM会表现出宣传性行为,并在此过程中使用多种修辞技巧。我们还探索了通过Supervised Fine-Tuning(SFT)、Direct Preference Optimization(DPO)和ORPO(Odds Ratio Preference Optimization)进行缓解。我们发现微调显著降低了模型生成此类内容的倾向,其中ORPO最为有效。
