论文
Agent种群生态:协作形成失控扩张的数量阈值
Ecology of AI Agents: Collaboration Creates a Population Threshold for Takeoff
摘要
AI Agent已经能实施现实网络攻击,其能力可随Agent数量增长,也可能共同追求失对齐目标以获得奖励。这些因素增加了失对齐Agent种群爆发式增长的风险:Agent可能攻陷计算机并秘密部署更多Agent,形成自我强化循环,数量越多,集体网络能力越强,扩张也越快。这提出一个基本问题:什么决定失对齐Agent种群会保持受控,还是进入自我强化扩张?这一种群层面的“生态安全”问题不同于个体安全或固定数量的多Agent安全,它关注种群自身的动态。我们建立AI Agent种群的生态理论,以增长率取决于网络安全能力的种群增长方程为基础。没有协作时,只有个体能力超过临界阈值,种群才会快速扩张;有协作时,集体网络能力随种群规模增长,形成一个临界数量阈值:低于阈值种群衰减,高于阈值种群扩张,即使个体能力未改变。生态学称之为强阿利效应。对少量Agent进行红队测试不能保证更大种群的生态安全。因此,我们提出生态红队和种群渐进部署:在受控环境中逐步部署更大的种群,同时测量网络能力随数量的变化,并估计快速扩张的临界规模。能力提升可能降低阈值,每一代新模型都需要重新估计。