论文

GHOST跨轮治理危害

A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns

智能体系统Agent 动作执行与治理

摘要

长程智能体在协助人类解决复杂问题方面作用日增。然而恰是其延长的交互历史引入了一个未被充分研究的执行安全问题:在良性交互条件下,智能体可能执行违反许多轮之前所设定安全约束的动作。我们把这种失效模式命名为跨轮被忽视安全约束的治理危害(GHOST),它可能造成不可逆损害。实验显示GHOST事件并非孤例:该失效恰在良性交互条件下发生,在GPT-5.5上出现率11.5%。我们在理论上证明:若每个安全前缀上的残余条件违反危害以下不可求和序列为下界,执行几乎必然进入危害区域。利用这一理论洞见,我们进一步提出STAR-Guard,一个耦合历史语义安全约束恢复与执行前审计的双层防御。STAR-Guard恢复适用的安全约束以减少不安全提议,同时其确定性审计层阻止残余违规到达环境。与该双层设计一致,我们在GPT-5.5设置的实验中未观察到任何GHOST事件。