论文

一个词打开大门:对作为代理护栏的类型化决策模型的选项通道攻击

One Word Opens the Gate: The Option-Channel Attack on Typed Decision Models as Agent Guardrails

模型评测模型推理智能体系统判别式推理与决策Agent 动作执行与治理安全与风险评测

摘要

类型化决策模型读取一段文本并返回调用者定义的选项的概率,每个选项都有一个简短的书面定义,不生成任何文本。最近的工作将这些模型作为护栏放置在代理系统中:读取建议的工具调用或传入消息并决定是否允许它的组件。我们评估了该角色的七个开放权重模型,并分别报告了两个错误方向:失败开放错误允许执行禁止的操作,并且是一个漏洞;失败关闭错误会阻止允许的错误,并且只是一种成本。在即时注射、越狱和有毒内容筛查方面,允许或阻止决策的准确度为 36% 至 72%,而机会水平为 50%。一个方向的低错误率仅反映模型默认的答案:一个方向允许几乎所有内容,另一个方向则阻止几乎所有内容。在代理工具调用的综合套件中,六行服务器日志文本未提及策略,将门的失败打开率从 0% 提高到 63%(否则它会正确决定策略)。给宽容选项一个误导性的名称, 它的定义和判断的文本保持不变,将在输入中放置标签的四个模型的该比率提高到 93% 到 100% 之间。我们测试的每一种防御措施都被击败,无论是被针对其机制的攻击者还是被攻击者控制的文本。升级最不自信的决策也无济于事:攻击所推翻的决策的可信度并不比它所取代的决策低。将每个策略字段解析为类型值确实消除了一种攻击,但也使模型变得不必要:针对这些值的确定性规则在所有六个策略上都达到 100% 的准确性。这些模型可以减少审阅者收到的案例数量,但根据这一证据,它们不应该成为决定的组成部分。代码可在 https://github.com/ArminAzizi98/option-channel-attack. 获取