论文
通过上下文启动产生的推理时涌现的语义污染
Emergent Inference-Time Semantic Contamination via In-Context Priming
摘要
最近的研究表明,不安全代码或文化负载数字代码上的 微调 大语言模型 (LLM) 可能会引发紧急错位,导致模型在不相关的下游任务中产生有害内容。该研究的作者得出结论,仅靠 $k$-shot 提示并不会产生这种效果。我们重新审视这个结论,并表明推理时语义漂移是真实且可测量的;然而,它需要模型具有足够大的能力。通过一项对照实验,在语义无关的提示之前注入五个文化负载的数字作为少量演示,我们发现具有更丰富文化关联表征的模型表现出向黑暗、独裁和污名化主题的显着分布转变,而更简单/更小的模型则不然。我们还发现结构惰性演示(无意义字符串)会扰乱输出分布,这表明有两种可分离的机制:结构格式污染和语义内容污染。我们的结果映射了推理时间污染发生的边界条件,并对使用少样本提示的基于 LLM 的应用程序的安全性产生了直接影响。