论文
单独对齐,一起错位:预测 LLM 代理群体中的对抗性捕获
Aligned Alone, Misaligned Together: Forecasting Adversarial Capture in LLM Agent Populations
摘要
人工智能安全评估的单位仍然是个体模型,但语言模型代理越来越多地部署在交互群体中,读写彼此的决策。这就提出了一个单一代理审计无法回答的问题:一个本身经过良好校准的代理可能仍然会被周围的代理拉向不同的决策。我们在一项安全分类任务中研究这一点,其中语言模型监视器群体决定是否升级或消除警报,并且我们可以在其中注入始终单向推动的坚定少数人。我们发现,单个代理自行判断几乎相同的两个警报可能会导致集体行为相距甚远,因此审核任何一个成员不需要揭示总体会做什么。然而,这种集体行为是可以提前预测的。仅从群体的良性、无对手的运作中,我们就可以校准一个响应函数,在进行任何攻击之前,该函数可以预测坚定的少数人随后会将其移动到什么程度。然后,我们询问是什么改变了结果,并发现让智能体看到彼此的推理可以抵消弱攻击,而只会延迟针对强攻击的攻击,从而将问题从群体是否会收敛于对手的选择转向何时收敛。最后,我们排除捕获是不可逆转陷阱的假设:一旦清除了坚持攻击目标的智能体,种群就会回到开始的地方,因此捕获是一种暂时状态。孤立的联盟并不是群体中的联盟,但可以通过在任何对手到来之前的行为来提前了解一个群体在受到攻击时会做什么。