论文

当场落网:调查有效发现破坏行为并发现无声的欺骗行为

Caught in the Act: Probes Effectively Detect Sabotage and Catch Unverbalized Deception

模型评测基准与评测资源安全与风险评测

摘要

最近的事件凸显了监督LLMAgent的挑战以及模型欺骗人们的危险。我们表明,通过收集迄今为止最大的欺骗数据集用于训练探针,并引入一种新颖的探针架构(可以跨多个层和token聚合信息),可以将通过探针进行的白盒欺骗检测扩展到前沿监控设置。我们的探针在 SHADE-Arena 中实现了 98.8% AUC,超过了 Opus 5.5 文本监控基线,并且随着基础模型的扩大,效率也得到了提高。为了将我们的调查推向极限,我们在几种无法仅根据上下文确定欺骗的情况下对其进行了测试。在这些情况下,我们将其称为内省欺骗,只有通过仔细引出或透彻了解模型的训练数据才能确定基本事实。在一项此类评估中,我们表明探针可以将包含模型真正隐藏目标的转录本与其他目标区分开来,AUC 高达 99.7%。我们的探测器还可以轻松检测到著名的开放式重量模型上的欺骗行为,这些模型 关于政治敏感话题,以及他们在压力下的信仰。我们发布了名为 FIBS 的训练数据集,以帮助推动有效探测器的前沿部署,并鼓励社区通过进一步的欺骗和破坏示例来扩展它。