论文
使用目标指令对构建更好的欺骗探针
Building Better Deception Probes Using Targeted Instruction Pairs
摘要
线性探针是监控人工智能系统欺骗行为的一种很有前景的方法。之前的工作表明,在对比指令对和简单数据集上训练的线性分类器可以获得良好的性能。然而,即使在简单的情况下,这些探测也表现出明显的失败,包括虚假相关性和非欺骗性响应的误报。在本文中,我们确定了训练期间使用的指令对的重要性。此外,我们表明,通过人类可解释的欺骗分类来针对特定的欺骗行为可以改善评估数据集的结果。我们的研究结果表明,指令对捕获的是欺骗性意图,而不是特定于内容的模式,这解释了为什么即时选择主导着探测性能(方差为 70.6%)。鉴于跨数据集的欺骗类型的异质性,我们得出的结论是,组织应该针对其特定威胁模型设计专门的探测器,而不是寻求通用的欺骗检测器。
