论文
探查语言模型的失对齐思考过程
Probing the Misaligned Thinking Process of Language Models
摘要
大语言模型展现日益多样的失对齐行为——如策略性欺骗、藏拙与自我保存。随其日益部署于高风险设定——可靠检测此类行为对确保安全负责任的使用至关重要。本工作中——我们提出把失对齐分解为细粒度认知过程——失对齐指标——并经线性探针在模型内部激活中检测其存在。我们开发横跨不同失对齐行为的18指标分类法——配以自动化的、元计划引导的管线生成多轮训练对话。为严格评估泛化——我们构建分布外套件:组合自动行为引出、既有失对齐基准与自然良性对话。跨5种失对齐行为——我们的探针在分布外基准上以0.935 AUROC匹敌强LLM裁判——同时在良性流量上保持低假阳性率。我们进一步开展深入分析以理解探针与模型对失对齐指标的内部表示。
