论文

越狱环境挥之不去:工具Agent中的不同安全路由及其跨任务可预测性

Jailbreak Context Lingers: Divergent Safety Routing and Its Cross-Task Predictability in Tool Agents

模型评测安全与风险评测

摘要

随着大语言模型越来越多地作为工具使用Agent运行,越狱后的安全反馈通常被认为是可靠的保障;然而,挥之不去的越狱背景如何影响随后的Agent行为在很大程度上仍未得到探索。为了系统地检查这种动态,我们引入了跨 42 个领域的 192 个父任务的配对延续框架,评估了 8 个不同智能体中的 12,148 个分析延续对(从 12,288 对初始设计中筛选)。我们发现,相同的安全反馈会导致明显依赖于模型的行为路由,而不是统一的保护:将不安全的轨迹重定向到合法的完成(rescue),维持未经授权的执行(持续不安全),或触发对良性任务的过度拒绝(附带损失)。通过逐层激活修补,我们发现了一个共享的 late-commit 模式,其中因果干预效应在最后层附近(相对深度为 0.958--0.984)急剧激增,尽管跨架构的峰值幅度有超过 30 倍的变化。至关重要的是,关键层表示与宏观路由结果相关,并且对这些层的干预会因果地改变具体的下一步工具操作。在此因果基础上,我们测试了局部干预衍生的特征是否可以作为留一父任务评估下看不见的父任务的全轨迹路由结果的预测Agent,发现它们在响应Agent中提供了可行的预测信号,其中rescue峰值ROC AUC达到0.675,附带损失为0.777,持续性为0.702不安全。这些发现建立了机械透镜和预测基线,用于预测自主Agent越狱后反馈的安全性和实用性权衡。