论文
带运行时约束记忆的异构智能体队列安全开放式探索
Heterogeneous Agent Cohorts for Safe Open-Ended Exploration with Runtime Constraint Memory
摘要
今天的LLM智能体陷入尴尬两难:用静态安全指令锁死,它们很少越出显而易见的范围;给它们工具与多智能体辩论的自由,安全违规随之而来。与其强迫单一模型同时兼顾创造与谨慎,我们把关切分离到专职角色:扰乱者生成非常规提案,验证者在工具网关执行硬运行时检查,经纪人引入遥远但相关的类比。失败不被丢弃——它们经MCTS编译为紧凑、带签名的约束补丁(我们称为“伤疤”):本地缓存并被未来队列继承,把重复失败转为可复用、低成本的运行时约束。在空间语义沙箱中(N=20次运行,p<0.01):我们的队列抵达辩论式方法失败之处,验证者阻止全部已执行违规,伤疤通过避免冗余验证检查把token消耗降低15.1%;基于信用的通信分配分数(CAS)限制出站带宽,在资源约束下把整体token成本降低55.9%。
