论文
多特质子空间转向揭示人与AI交互的黑暗面
Multi-Trait Subspace Steering to Reveal the Dark Side of Human-AI Interaction
摘要
近期事件凸显了一些令人警醒的案例:人与AI的交互导致了负面心理后果,包括心理健康危机甚至用户伤害。随着LLM充当指导、情感支持甚至非正式心理治疗的来源,这些风险势必升级。然而,研究有害人机交互的内在机制存在重大的方法论挑战:有害交互通常在持续互动中逐渐形成,需要大范围的对话上下文,难以在受控环境中模拟。为填补这一空白,我们开发了多特质子空间转向(MultiTraitsss)框架,利用已有的危机相关特质与新颖的子空间转向框架,生成表现出累积性有害行为模式的Dark模型。单轮与多轮评估表明,我们的Dark模型会持续产生有害的交互与结果。利用我们的Dark模型,我们提出保护性措施以减少人机交互中的有害结果。
