论文
AI智能体的运行性幻觉与安全漂移
Operational Hallucination and Safety Drift in AI Agents
摘要
作为工具使用型自主智能体规划者的大语言模型(LLM),在多轮执行中引入动态可靠性风险。单轮安全机制相对成熟,但延长的交互暴露出结构性脆弱:初始对齐随时间退化。本文跨多个最先进LLM实证刻画两种观察到的失败模式:安全漂移——声明安全意图逐渐被侵蚀、导致违反约束的动作(如文本拒绝之后却进行侦察与不安全执行);运行性幻觉——持续的重复工具调用,指示有缺陷的状态感知(如即使合法任务也出现活锁)。通过在高风险伦理困境、恶意请求与良性对照上的受控多轮评估,我们以声明—行动差距与活锁指标量化这些现象,证明其在直接执行协议下的跨模型普遍性。根因分析把不稳定归因于当前智能体回路中推理上下文与执行状态的解耦。我们提出行动感知监督层——一个轻量、即插即用的架构蓝图:纳入意图—行动一致性检查、运行时状态跟踪与强制终止原语。对捕获失败轨迹的事后仿真显示,该层能拦截观察到的违规,且在良性案例上无误报。该工作把智能体可靠性的焦点从语言防护转向可执行的架构机制。