论文
有害内容并不足够:延续性框架调节上下文内涌现性失对齐
Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment
摘要
上下文学习(ICL)可诱发涌现性失对齐(EM):少量窄域的失对齐示例会改变模型对无关问题的回答。然而,现有提示词将有害文本暴露与延续助手行为的邀请混为一谈。我们保持有害答案不变,仅改变其呈现方式:作为示例、证据、助手历史或工具输出。在十个独立采样的上下文中,示例框架在一个易感的Gemini模型上将广义EM提高30–32个百分点;该差距在领域排除、语义聚类、未见问题和四种提示词模板下依然存在。格式与长度匹配的对照表明,有害内容是必要条件但不充分。角色×延续方式的析因实验进一步揭示依赖模型的来源效应:Gemini同时遵循助手历史和工具历史,而Grok在很大程度上抵抗工具框架的延续。其他若干前沿及开放权重模型未显示差距。盲测人类审计证实每个主要对比,并显示模型裁判低估了实验条件下的失败。因此,延续性框架是ICL-EM的一个强且依赖模型的调节因素,而非有害上下文的普遍后果。
