论文
Environment Steering:用数据流控制约束Agent执行并帮助恢复
Environment Steering: Using Data Flow Control to Improve Agent Utility and Safety
摘要
即使被指示安全行事,LLM Agent也可能会进行不安全的工具调用。现有的防御措施在执行前限制Agent,修改工具输入/输出,或依赖LLM评审;这些方法可能取决于模型行为或阻止不安全的操作而不帮助Agent恢复。我们认为,执行环境应该在Agent运行时强制执行安全性,并在发生违规时引导其转向安全的替代方案——我们称之为环境引导。我们通过将Agent建模并利用执行状态作为数据库表来实现这一点,跟踪记录级数据流,并在运行时根据声明性策略检查这些数据流。当检测到违规行为时,特定于策略和上下文的反馈会引导Agent走向安全轨迹。在 AgentDyn 上,这使得Agent能够比无防御提高任务成功率,同时实现 0% 的攻击成功率。