论文
SafeCommit:认证记忆支撑Agent何时可以安全行动
SafeCommit: Certifying When Memory-Grounded Agents May Safely Act
摘要
长短期记忆的代理越来越多地依赖持久的记忆和工具来执行具有外部副作用的行为。中央失败模式是:代理在确认其内存基础是否过时、冲突、不完整或被破坏之前就采取行动。我们将这一问题正式化为在内存不确定性下安全承诺,并引入SafeCommit,这是一个介于代理推理与外部执行之间的风险控制层。该层从记忆、观察、工具输出、来源和政策约束中构建一个校准的潜在世界集合。只有当符合性行动证书表明所选动作在所有保留的世界中都是安全的时,才能进行侧效应行为。否则,它选择一个低侧效应探针,针对阻止认证的领域,或者返回保守的后退方案。在校准的世界覆盖下,已知的安全认证失败的概率最多为目标水平α;在不完美的世界提议情况下,界限将校准和表示错误区分开来。无依赖性的控制模拟器展示了安全-实用性权衡,并以一个命令复现所有报告的结果。目标是提供一个具体的方法,不仅决定代理应该做什么,而且当可用证据足以安全执行时,还决定何时有足够的证据进行安全操作。