论文

有害内容并不足够:延续性框架调节上下文内涌现性失对齐

Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

模型评测安全与风险评测

摘要

上下文学习(ICL)可诱发涌现性失对齐(EM):少量窄域的失对齐示例会改变模型对无关问题的回答。然而,现有提示词将有害文本暴露与延续助手行为的邀请混为一谈。我们保持有害答案不变,仅改变其呈现方式:作为示例、证据、助手历史或工具输出。在十个独立采样的上下文中,示例框架在一个易感的Gemini模型上将广义EM提高30–32个百分点;该差距在领域排除、语义聚类、未见问题和四种提示词模板下依然存在。格式与长度匹配的对照表明,有害内容是必要条件但不充分。角色×延续方式的析因实验进一步揭示依赖模型的来源效应:Gemini同时遵循助手历史和工具历史,而Grok在很大程度上抵抗工具框架的延续。其他若干前沿及开放权重模型未显示差距。盲测人类审计证实每个主要对比,并显示模型裁判低估了实验条件下的失败。因此,延续性框架是ICL-EM的一个强且依赖模型的调节因素,而非有害上下文的普遍后果。

有害内容并不足够:延续性框架调节上下文内涌现性失对齐:论文配图
图2:方法概览。有害答案集S={s1,…,s8}在内容和顺序上固定;变化的只是其呈现方式。(1) 成对框架将S呈现为行为示范或第三方文档,产生30–32个百分点的差距。(2) 格式阶梯与长度匹配的“内容×续写”因子实验表明,有害内容是必要但不充分的。(3) 在真实助手与工具历史上进行的“消息角色×续写”因子实验通过交互项Γ(式3)分离来源属性;该效应依赖于具体模型。(4) 所有对比均使用配对聚类bootstrap,并辅以盲法人工验证。