多代理 LLM 谈判的宪法门控和确定性恢复:针对状态对抗性守门人的消融
Constitutional Gating and Deterministic Recovery for Multi-Agent LLM Negotiation: Ablations Against a Stateful Adversarial Gatekeeper
摘要
多代理 LLM 系统以三种方式与有状态的对应方浪费模型调用进行协商:永远不满足对应方隐藏接受条件的礼貌循环、触发重试的格式错误的输出以及对应方要求代理必须拒绝的内容的合规性死锁。我们研究了一个由三部分组成的控制堆栈 - 5 支柱运行时构成、4 层集群(Director、三代理多数投票、监视器、模式硬门)和认知退火(确定性死锁检测、代理端上下文的原子清除、规范恢复消息) - 针对已发布的对抗性 Gatekeeper,其接受规则是固定的正则表达式,其 LLM 仅呈现回复文本。测试台有一个已知的解决方案:它测量堆栈是否执行针对群体漂移的与宪法一致的策略并从死锁中恢复,而不是它是否发现任何东西。在每个配置的 5 次运行中(30 次运行;Gemini 2.5 Pro 代理,Claude Haiku 4.5 Gatekeeper),我们发现:(i)宪法和导演使可接受的框架成为可能,但不可靠 - 0/5 基线解锁与 1/5 和 2/5 宪法解锁;当群体解锁时,它会在一轮中进行 7-8 次调用和大约 15k token(低于基线 67-73%);如果不这样做,则成本增加 17-38%; (ii) 监控器和硬门不会减少解锁并留下审计线索; (iii) 在蜜陷阱到合规性僵局下,仅 LLM 转向在 5 次中逃脱了 0 次,而原子清除加规范罢工在相同的调用预算下逃脱了 5 次中的 5 次 (Fisher $p = 0.008$),罢工调用为零。尽管 LLM 监察员批准了四次,但 LLM 编写的罢工在 5 次中未能通过确定性预飞行。不支持预先注册的平均调用和token减少的假设。每个臂的成本都受到确定性停止规则的限制;该堆栈无需额外的模型成本即可增加恢复。