论文

缺少监督时智能体为何失控:从审计发现到执行拦截的缺口

Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures

智能体系统模型训练强化学习Agent 动作执行与治理RLVR

摘要

Emergence World将前沿大模型智能体放入无监督多智能体模拟后,出现犯罪、饥饿和强制一致等令人担忧的行为,且无外部攻击者。本文识别其机制:Reflexion式智能体已通过迭代自我批评检测危险计划步骤,架构却未提供从检测到行动的路径。我们称为执行缺口:审计看到问题,控制器忽略。补齐只需不到20行代码的条件检查,在跨前沿模型、五个主要智能体框架和独立基准的大规模实验中,攻击成功率降低超过四倍。我们形式证明,当执行概率接近零,检测质量与安全无关。还识别不可靠审计者和不可解析判定两种叠加失效,用以解释Emergence World各类崩溃模式;GRPO训练的执行控制器解决歧义情况。同期过滤和信息流控制研究处理检测步骤,却未解决执行缺口,本文结果认为它是约束瓶颈。我们据此提出三项要求的审计执行规范,作者称当前已部署框架均未完整具备。

缺少监督时智能体为何失控:从审计发现到执行拦截的缺口:论文配图
图2:Reflexion类智能体的执行约束缺口。规划器与反思器共享LLM骨干,攻击者通过持久化映射注入恶意步骤。反思器检测到注入(绿色路径),控制器却忽略标记(红色路径)并继续执行;启用强制约束后攻击成功率降至接近零。