论文
仲裁者智能体:持续监控多智能体对话以检测涌现失对齐
The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment
摘要
随着由多种语言模型代理构建的人工智能系统变得越来越普遍,它们越来越多地用于一起做出决策:讨论、谈判和执行共享任务。虽然单个代理在单独测试时可能看起来协调一致,但它们之间的交互方式可能会出现问题。我们引入了 Arbiter,这是一种旨在实时监控多代理对话并识别哪些参与者可能行为不一致的代理。仲裁者在有限的“检查预算”下运作,这意味着它必须仔细决定如何使用其资源。当它逐步观察对话时,它可以选择等待、询问参与者、检查内部信息(例如系统提示或推理痕迹)或记录有关行为。最后,它会生成一份报告,确定可能的错位来源。我们在五种对话条件下评估仲裁者,从有风险的财务建议模型有机体到具有评估意识和共谋的代理,我们测试了五种增强能力的工具配置和两个骨干模型。我们发现仲裁器可以在对话结束之前可靠地检测到未对准的代理,并使用主动检查工具提高检测准确性和速度。权重修改引起的错位被证明是最难检测的,而指令引起的错位即使在被动观察下也能可靠地识别。记录工具具有双重效果,以牺牲精确度为代价来提高召回率。这些结果表明,持续的、有预算意识的监控可以有效地发现偏差,并且监督多代理系统可能需要将审计师视为流程的积极参与者。该代码可从 https://github.com/aisilab/arbiter 获取。