论文
有毒幻觉:扰动提示和追踪 LLM 电路
Toxic HallucinAItions: Perturbing Prompts and Tracing LLM Circuits
摘要
大语言模型 (LLM) 越来越多地部署在会话环境中,其中用户语气从礼貌到敌对或有毒,但人们对语义等效提示中的有毒语言是否会降低事实可靠性知之甚少。我们研究词汇和基于声调的提示扰动如何影响 LLM 的事实可靠性。使用礼貌、随机和三个毒性级别的受控提示变化,我们在 ARC-Easy、GSM8K 和 MMLU 上评估了五个 LLM。我们发现,有毒的词汇扰动始终会降低事实的准确性并增加不确定性,而礼貌的措辞会产生有限且不一致的变化。为了检查这些答案不一致是否对应于内部变化,我们对模型激活和影响进行归因图分析。我们发现,增加毒性选择性地放大扰动敏感的变异节点,而相对稳定的核心推理节点则保持更不变。这些发现将提示音定位为 LLM 可靠性的一个关键维度,并提供了行为和机制证据,表明表面词汇变化可以改变事实输出和内部计算。