论文
Algospeak,隐藏在公开场合:清晰含义和避免检测之间的权衡
Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance
摘要
随着 大语言模型 (LLM) 越来越多地调解内容生成和审核,被称为 Algospeak 的语言规避策略加剧了规避者和检测者之间的共同进化。这项研究将基于联合行动模型的潜在动态形式化:当 Algospeak 增加时,可检测性和可理解性会降低。此外,引入了多数可理解调制(MUM)的概念,并将其定义为调制级别,在该调制级别上,额外的规避改变会增加检测器的规避,但会失去大多数接收者的理解。为了凭经验探索这种权衡,我们引入了一个可重复的框架,可用于基于现有分类法和可调调制级别创建保留意义的 Algospeak 风格变体。使用 COVID-19 虚假信息作为第一个示例证明设置,我们构建了一个包含 700 个调制项目的参考数据集,这些项目来自跨五个调制级别和七种策略的 20 个基本句子。然后,我们使用七种不同的语言模型运行两项链接评估:一项通过意义恢复来测试解释,一项通过分类来测试虚假信息。对调制级别进行曲线拟合可得出多数可理解调制阈值的估计值,并支持跨策略和模型的敏感性分析,请参见图 1。结果揭示了可理解性与调制之间的特征关系。这项研究为理解 Algospeak 背后的动态奠定了基础,并提供了所描述的框架、数据集和实验设置。