论文
花招基准:语言模型能否注意到自己的输出是否被篡改?
Sleight of Word Benchmark: Can Language Models Notice If Their Own Output Was Tampered With?
摘要
语言模型的输出可以在模型编写时被篡改。因此,可以通过评估模型对这种外部扰动的感知来构建一个简单的测试。本着这种精神,建立了一个简单的基准,在生成过程中,单个单词始终被另一个单词替换。我们称这种方法为\emph{花招}。测量两个不同的轴:与模型惊喜相关的指标,以及对 19 种不同开放权重语言模型的文本反应的评估。