论文
消除偏差的幻觉:角色引导重新分配而不是减少 LLM 中的偏差
The Illusion of Debiasing: Persona Steering Redistributes Rather Than Reduces Bias in LLMs
摘要
基于提示的干预:系统提示、角色、角色指令,可靠地重塑语言模型所说的内容,但尚不清楚它们到达哪一层。他们重新配置内部结构,还是只调制输出通道?我们使用角色调节作为受控探针,测量其沿着深度轴的影响,从自我报告到开放式生成,再到单词级参数关联,跨越三个指令调整模型。我们发现分级解离。人物角色清晰但不具有结构性:模型遵循单一特征指令,但无法重现人类特征间的协方差。这种分离随着深度的加深而加深:角色持有或放大封闭式的 QA 偏见,改变绝对基调,同时保持组间差异不变,并且几乎不会扰乱已经饱和的关联基线。因此,基于提示的转向在输出通道中运行,并且具有表面可操纵性可以掩盖的结构范围限制。