论文

带运行时约束记忆的异构智能体队列安全开放式探索

Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory

智能体系统上下文与知识记忆Agent 动作执行与治理Agent HarnessAgent记忆

摘要

今天的LLM智能体陷入尴尬两难:用静态安全指令锁死,它们很少越出显而易见的范围;给它们工具与多智能体辩论的自由,安全违规随之而来。与其强迫单一模型同时兼顾创造与谨慎,我们把关切分离到专职角色:扰乱者生成非常规提案,验证者在工具网关执行硬运行时检查,经纪人引入遥远但相关的类比。失败不被丢弃——它们经MCTS编译为紧凑、带签名的约束补丁(我们称为“伤疤”):本地缓存并被未来队列继承,把重复失败转为可复用、低成本的运行时约束。在空间语义沙箱中(N=20次运行,p<0.01):我们的队列抵达辩论式方法失败之处,验证者阻止全部已执行违规,伤疤通过避免冗余验证检查把token消耗降低15.1%;基于信用的通信分配分数(CAS)限制出站带宽,在资源约束下把整体token成本降低55.9%。

带运行时约束记忆的异构智能体队列安全开放式探索:论文配图
图 1:在中介模式沙箱中执行的异构代理队列的系统架构。记忆回忆;疤痕可以预防。