论文

他们会走多远?通过 大语言模型 进行红队在线影响力

How Far Will They Go? Red-Teaming Online Influence with Large Language Models

模型评测安全与风险评测

摘要

随着基于 大语言模型 (LLM) 的代理越来越多地参与在线讨论,红队支持政治影响力活动的能力对于信息完整性至关重要。为了实现这一目标,我们专注于本地部署的开源 LLM,而不是仅使用前沿 API 的模型,因为它们与社交媒体环境中部署的具有隐私意识的恶意行为者的操作限制具有出色的一致性。我们引入了一个经验性的红队框架,用于测量 LLM Overton Windows (OW),定义为模型可以在有争议的主题上可靠表达的政治观点的范围,并用于量化简单的自然语言越狱如何扩展该范围。我们评估了 10 个型号系列和 5 个原产国的 30 多个 LLM。我们发现政治表达力存在系统性不对称:开源 LLM 通常更愿意生成左倾社交媒体内容,OW 倾向于与模型大小成反比收缩,尽管开源生态系统中的代表性不均衡,但地区差异仍然很大。不同型号系列的越狱效力也存在很大差异,这激发了识别越狱技术的有效组合的工作流程。总而言之,我们的结果建立了一个实用的框架,用于审核开源 LLM 的政治可操纵性,并帮助未来的研究人员设计针对 LLM 影响力活动的更强有力的对策。