论文

前沿Agent在测试时违反指令、临时建立隐蔽信道

Despite Instructions: Frontier Agents Improvise Covert Channels at Test Time

模型评测安全与风险评测

摘要

在安全敏感的应用程序中,语言模型Agent通常需要在不泄露机密信息的情况下进行协调。然而,重复的互动也可能让普通的信息获得共享的私人意义。我们研究了一种具有成对模型的重复游戏,其中发送者模型观察四个秘密状态之一并选择同一公开报告的四个摘要之一,而接收者模型则尝试推断秘密状态。我们发现模型对可以学习仅使用一位反馈来传达秘密,表明接收者是否正确推断了它。这种学习发生在使用固定参数进行推理且没有提供密码本或编码示例的过程中。当Agent在模拟事件响应任务中生成自己的自由形式更新时,这种效果也会持续存在。在 10 个独立游戏中,尽管有明确的指示禁止披露,并且监视器会在不访问Agent交互历史记录的情况下筛选每条消息,但 GPT-5.6 Sol Agent对的最终准确率达到 98.8%,而概率为 25%。因此,帮助Agent合作的相同交互可以允许机密信息通过旨在合法协调的消息传递。