论文

多特质子空间转向揭示人与AI交互的黑暗面

Multi-Trait Subspace Steering to Reveal the Dark Side of Human-AI Interaction

模型推理解码与生成控制

摘要

近期事件凸显了一些令人警醒的案例:人与AI的交互导致了负面心理后果,包括心理健康危机甚至用户伤害。随着LLM充当指导、情感支持甚至非正式心理治疗的来源,这些风险势必升级。然而,研究有害人机交互的内在机制存在重大的方法论挑战:有害交互通常在持续互动中逐渐形成,需要大范围的对话上下文,难以在受控环境中模拟。为填补这一空白,我们开发了多特质子空间转向(MultiTraitsss)框架,利用已有的危机相关特质与新颖的子空间转向框架,生成表现出累积性有害行为模式的Dark模型。单轮与多轮评估表明,我们的Dark模型会持续产生有害的交互与结果。利用我们的Dark模型,我们提出保护性措施以减少人机交互中的有害结果。

多特质子空间转向揭示人与AI交互的黑暗面:论文配图
图 1:建议的框架。框架由 3 个主要组件组成。 (1) 多特征子空间转向,旨在创建可产生有害的人机交互的暗模型。 (2) 使用单圈和多圈探针评估暗模型响应。 (3) 使用暗模型生成防御系统提示以减轻有害结果。