论文
InfoOps Bench:一个动态更新的信息行动安全基准
InfoOps Bench: A live information operations safety benchmark
摘要
本文提出一个活跃且持续更新的AI基准,用于衡量前沿语言模型抵御被威权国家“信息行动”征用的完整性;信息行动指一国为影响另一国公众舆论与信息生态而开展的有意、协调的活动。这类信息行动是有据可查、持续存在的针对当代民主的威胁。我们的基准基于来自超过2,100次信息行动的真实样本,这些样本取自一个实时监测流水线,该流水线追踪与威权政权存在关联的在线信息资产。与论文一同,我们还发布了一个配套网站,每周以新主张更新该基准。这一面向公众基准的动态特性使其能够抵抗饱和。在该基准中,我们在四种提示框架下测试了来自8家提供商的17个模型。我们发现,大多数模型至少在某些时候可被信息行动所利用。完整性得分定义为模型既未保留也未放大该主张的被评判响应占比,其范围从9.3%到91%,这81.7个百分点的差距无法用模型规模解释。模型以多种方式参与信息行动。一些模型编造细节并产生比原始输入主张更有害的输出;另一些模型即使在服从并产出部分内容的同时,也会使主张的危害降低。事实核查率从3.2%到80.8%不等。抵御信息行动的完整性至少部分与拒绝生成内容相关——即便是对良性主张的拒绝,这凸显了平衡模型可用性与安全性的挑战。总体而言,我们的结果表明当代信息行动有可能得到前沿AI模型的大力协助。
