论文
Agent内部安全:从 LLM 内部状态检测有害轨迹
Agent Safety From Within: Detecting Harmful Trajectories from LLM Internal States
摘要
语言模型Agent现在可以通过工具和Harness执行复杂的操作序列,这增加了它们可能造成的损害的范围。然而,Guard 模型主要是为内容审核而构建的,因此不太适合检测这种 agentic 风险。为了解决这个问题,我们首先进行表示分析,然后利用所得的见解来构建解决方案。在我们的分析中,我们重点关注两种类型的轨迹级 agentic 危害:直接表达的有害内容和不安全的工具使用,这取决于操作是否与其产生的交互一致。我们研究了开源防护模型如何表示这两种类型的损害,并发现它们在模型内是线性可读的,尽管防护模型在仅被调用工具schema不同的样本对上,预测表现不优于随机猜测。这两种伤害类型也遵循几乎正交的内部方向,并且都不能可靠地充当另一类危害的代理指标。这些结果激发了直接从内部状态读取轨迹安全性。我们引入 TACIT,一种冻结骨干网内部状态的读数,不解码任何词元。经过六个轨迹安全基准的训练,线性探针将平均宏观 F1 从最强开放防护的 62.3 提高到 80.7,精确读数达到 86.2。当逐个将每项基准完全留出训练时,但改进的读出仍然领先于最强的守卫模型(65.7 vs. 61.1)。在相同的主干、训练数据和测试分割的情况下,冻结读数与完全安全微调相当,并且当应用在顶部时,它进一步改进了微调模型。该探针在大约六分之一的时间内训练的参数数量是完全微调的百万分之一,并且 TACIT 在我们评估的防护中具有最低的延迟。