论文
Magnet:通过能力累积检测跨会话AI滥用
Magnet: Detecting Cross-Session AI Misuse Through Capability Accumulation
摘要
最强大的AI部署不是单一模型,而是由专门的代理组成的代理群,这些代理在协调下执行任务。这种架构解锁了新的强大功能,同时也引入了风险,这些风险现有的监控、检测和缓解框架未能应对。大多数最新的AI滥用检测文献专注于单回合或多回合(单会话)威胁模型。这留下了一个关键的缺口:攻击者可以将有害的目标分解成看似无害的单元,并在孤立的代理会话中执行每个单元。代理是会话之间的状态无状态的,但攻击者不是。这种不对称性允许跨会话轨迹,这些轨迹在避免检测方面非常有效。我们的贡献是两方面的。首先,我们展示了跨会话目标分解作为逃避技术,表明它可能比等效的单回合或多回合攻击产生更多的有害能力。我们所说的“能力”是指在目标的某个步骤中产生的结果,由交互产生的(模型响应和工具调用结果),并且可以与其他地方积累的能力组合成有害的整体。其次,我们提出了Magnet:一种高效的和可靠的检测方法,它模型了随着时间的积累的相关能力,并在代理会话之间而不是会话状态级别上进行聚合。主要挑战是组装Magnet需要处理的证据包。Magnet的证据可能是在一个看似无害的会话中散落的针,单独无害,但只有收集在一起才危险。与逐会话搜索不同,Magnet所做的就是吸引相关的针,跨会话和跨时间,进入一个紧凑的证据包,检测器可以对此采取行动。
