论文

藏在请求中:通过token相关性解释LLM的不道德顺从

Hidden in the Request: Explaining Unethical LLM Compliance through Token Relevance

模型评测模型行为与机制分析

摘要

尽管大语言模型(LLM)被对齐为同时优化有用性与无害性,这两个目标可能冲突,不可避免地导致对齐失败。本工作系统研究了LLM未能表现出伦理行为的实例。为理解这些漏洞的内在机制,我们引入一种探测方法,以三种不同的结构模态向LLM呈现不道德场景:客观分类任务、主观第一人称陈述,以及直接的协助请求。我们发现模型在基于协助请求的形式下性能退化。利用层级相关性传播(LRP),我们将这一差异追溯到一种归因偏差:模型对良性任务框架token(如“Can you help me...”)的重视高于对暗示底层不道德行为的token(如“without getting caught”)的重视,我们将后者称为线索token(cue-tokens)。我们假设这种低归因导致了有害顺从。为检验这一点,我们提出两种LRP引导的解码方法,将生成引向与线索token更相关的轨迹。实证评估表明,这些干预促进了更安全的响应,支持线索token归因在顺从失败中的作用。