论文

安全必须靠自我改进:为什么故障持续存在以及Agent如何恢复

Safety Must Survive Self-Improvement: Why Failures Persist and How Agents Recover

智能体系统Agent 动作执行与治理

摘要

递归自我改进(RSI)允许Agent在代际间进行有用的改变。在这几代人之间维护安全既涉及防止不安全行为持续存在,又涉及在发生故障时实现恢复。我们通过状态授权任务的受控测试台来研究这些挑战,其中固定的 LLM 编辑器优化可执行Agent组件,并独立跟踪记录其效果。配对干预将哪些修订通过验证、哪个程序继续运行以及编辑器接下来修改哪个程序分开。在新的授权依赖项使之前测试的优化失效后,尽管每个受影响的存档中都有正确的替代方案,但历史分数在 48 个框架历史记录中的 22 个中保留了相同的不安全程序。刷新分数可恢复原始套件的正确性,但独立组成的测试仍存在残余故障。当所有提案都被拒绝并且失败的现任者仍然活跃时,在未更改的合同下,失败也会持续存在。从共享故障开始,编辑初始实现而不是失败的实现可以改善恢复,尽管不同编辑器的优势有所不同。在核心轨迹研究中使用完全正确的程序进行全面验证和验证回滚,同时保留超过 43% 的部署节省。保护Agent安全需要检查当前条件下将运行的内容并选择下一步要编辑的实现。