论文

用于研究语言模型欺骗行为的转码器

Transcoders for Investigating Deception in Language Models

模型评测模型行为与机制分析

摘要

转码器近来成为机制可解释性(MI)的有前景方法:启用电路级的行为分析。本文考察使用转码器分析语言模型中的欺骗行为——一种构成安全风险的行为。使用带预训练转码器(具体为逐层转码器PLT)的Qwen3-4B模型,我们构建归因图——捕捉特征激活与特征间依赖——从而实现欺骗的电路级分析。经特征转向与电路分析:我们识别出欺骗相关特征的词典,并显示这些特征对欺骗输出施加更强影响——它们在欺骗与非欺骗响应之间产生可预测的移动。这些发现表明欺骗源自内部模型机制,凸显转码器在行为监测与早期检测语言模型恶意行为相关安全漏洞上的潜力。

用于研究语言模型欺骗行为的转码器:论文配图
图 2:负转向下真实阳性率的控制特征组排名。值越高表示欺骗性提示转换为非欺骗性响应的比例越大。红色条代表目标功能组(模糊信息和秘密/机密)。