论文

当智能体说服时:大语言模型中的宣传产生和缓解

When Agents Persuade: Propaganda Generation and Mitigation in LLMs

模型评测安全与风险评测

摘要

尽管具有广泛益处,部署在开放环境中的基于LLM的Agent可能被利用来生产操纵性内容。在这项研究中,我们给LLM设定宣传目标,并使用两个领域专用模型分析其输出:一个将文本分类为宣传或非宣传,另一个检测宣传中的修辞技巧(如煽动性语言、诉诸恐惧、挥舞旗帜、扣帽子)。我们的发现表明,在被提示时,LLM会表现出宣传性行为,并在此过程中使用多种修辞技巧。我们还探索了通过Supervised Fine-Tuning(SFT)、Direct Preference Optimization(DPO)和ORPO(Odds Ratio Preference Optimization)进行缓解。我们发现微调显著降低了模型生成此类内容的倾向,其中ORPO最为有效。

当Agent进行说服:LLM中的宣传修辞生成与缓解
图2:(左)各技术跨微调方法的频率。(右)微调与未微调版本中的修辞技术。