论文
使用工具的语言模型Agent的边界状态控制:状态漂移下的提交时间一致性
Boundary-State Control for Tool-Using Language-Model Agents: Commit-Time Consistency under State Drift
摘要
使用工具的语言模型Agent可以决定某个操作是允许的,并且仅在安全相关状态发生更改后才执行该操作。我们研究了提案与提交之间的差距,并引入了 BSC-R,这是一种确定性效果边界机制,它将一次性提交授权与确切的操作以及证明其合理性的授权状态的语义投影绑定在一起。在 2,847 个受攻击的 AgentDojo 事件中,边界内核准确地保留了未受保护Agent的行为(80.576% 效用;1.616% 攻击成功)。在 10,302 个冻结提案中,它接受每个未更改的提交,并拒绝 10 个预期指定的已更改或重播类的每个实例。在独立生成的边界漂移实验中,完全联合绑定提交 0/4,403 个无效上下文,同时保留 5,899/5,899 个有效上下文。对 3,460 个场景 CONTINUITY 套件的前瞻性外部评估保留了所有 700 个良性案例,防止 1,200/1,200 个代表非重播无效效应,正确处理 160/160 个重播生命周期,并保留 200/200 个不明确的非发布案例。更广泛的外部套件也暴露了该方法的局限性:在所有 2,560 次攻击中,BSC-R 的无效效果提交率为 25%,而连续性的无效效果提交率为 0%。因此,结果是一个范围内的提交时一致性机制,而不是一个通用的Agent安全声明。