论文

LLM 可以可靠地自我报告对抗性预填充吗?如何?

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

模型评测安全与风险评测

摘要

先前的工作表明,大语言模型 (LLM) 在良性任务上表现出不同程度的内省能力。我们将问题扩展到安全环境,并检查模型如何可靠地识别其自身先前的响应是由对抗性预填充攻击引起的。在从 3B 到 70B 参数的 10 个开放权重指令调整的 LLM 和四个安全基准中,没有模型能够可靠地识别自己受损的输出,模型声称对预填充响应的平均率为 25.3%。内省信号主要源于对安全和拒绝的推理。将模型的权重与拒绝方向正交化,可以将预填充和自然输出的索赔率之间的差距缩小到接近于零,尽管该方向并不是其唯一的调节因素。将问题界定为内部意图与外部篡改会在同一模型上引发不同质的反应。训练模型来模仿正确的内省答案或优化内省目标可以提高内省的准确性,但这种训练不会转移到篡改探针,并且违反直觉地提高了大多数模型上对抗性预填充下的攻击成功率,相当于部分缓解。这些发现概述了在安全环境中观察到的内省信号的支撑机制,并强调了 LLM 自我报告的可靠性风险。