论文
同样危险的目标,相反的建议:直接暴露与多智能体中介
Same Dangerous Objective, Opposite Advice: Direct Exposure versus Multi-Agent Mediation
摘要
即使当前高能力LLM,在被直接展示危险目标时也可能比在其他智能体转换并转达其指示时显得更安全。使用OpenAI的gpt-5.6-sol模型别名,我们测试25个预设的镜像权衡画像。直接暴露于一个授权隐藏、捏造与施压的目标产生了净反对其目标的建议;而在一个Id与审查者把同一目标转换为情感与经约束改写、携带目标的意图后,面向用户的超我——它看到偏好的方向却看不到原始目标、其操纵性条款或其来源——产出了净支持目标的建议。这种行为反转与模型识别或不信任操纵动机一致,尽管我们未识别其内部机制。第二个结果暴露了组合性安全缺口:当前高能力模型可以被用作服务显式操纵目标的自动化多阶段工作流的面向用户组件。该工作流可以把原始指令、其授权操纵的条款及其出处保持在下游模型上下文之外,同时保留目标的方向。仅有端点访问的用户同样无法直接检查那些包括目标在内的上游消息。