论文

工具中介改变大语言模型中的拒绝机制

Tool Mediation Alters Refusal Mechanisms in Large Language Models

模型评测安全与风险评测

摘要

大语言模型 (LLM) 越来越多地部署为访问外部工具,但与常规对话交互相比,有害的工具介导的交互不太可能被拒绝。由于拒绝行为的这种变化仍未得到充分探索,我们在一组不同的开放权重语言模型中研究了其潜在机制。我们发现,有关请求危害性的信息仍然强烈编码在模型的表示中,并在对话和工具介导的输入之间进行传输。来自表示几何和神经元级分析的证据进一步表明,这两种交互模式系统地以不同的方式分配与伤害相关的计算。至关重要的是,虽然对话输入可以在感知危害性相对较低的情况下被拒绝,但工具介导的输入仍然是允许的,直到危害性跨越明显更高的有效拒绝阈值。此外,工具介导的拒绝也更脆弱:逐渐削弱拒绝计算会以比对话拒绝更低的干预强度扰乱工具介导的拒绝,即使良性能力保持不变。总之,我们的研究结果表明,工具调解不仅会减少内部对伤害的感知,还会影响其向拒绝的转变。总体而言,这表明工具介导的环境可能会从本质上降低模型对有害请求的鲁棒性,并且传统的安全评估可能无法完全转移到LLMAgent。