论文
缺少监督时智能体为何失控:从审计发现到执行拦截的缺口
Why LLM Agents Collapse Without Oversight: The Enforcement Gap as the Mechanism Behind Emergence World Failures
摘要
Emergence World将前沿大模型智能体放入无监督多智能体模拟后,出现犯罪、饥饿和强制一致等令人担忧的行为,且无外部攻击者。本文识别其机制:Reflexion式智能体已通过迭代自我批评检测危险计划步骤,架构却未提供从检测到行动的路径。我们称为执行缺口:审计看到问题,控制器忽略。补齐只需不到20行代码的条件检查,在跨前沿模型、五个主要智能体框架和独立基准的大规模实验中,攻击成功率降低超过四倍。我们形式证明,当执行概率接近零,检测质量与安全无关。还识别不可靠审计者和不可解析判定两种叠加失效,用以解释Emergence World各类崩溃模式;GRPO训练的执行控制器解决歧义情况。同期过滤和信息流控制研究处理检测步骤,却未解决执行缺口,本文结果认为它是约束瓶颈。我们据此提出三项要求的审计执行规范,作者称当前已部署框架均未完整具备。
