论文

信息获取如何影响LLM监控器检测破坏行为的能力?

How does information access affect LLM monitors' ability to detect sabotage?

模型评测评测方法与指标

摘要

前沿语言模型代理可能会表现出不协调的行为,包括欺骗、利用奖励黑客和追求隐藏的目标。为了控制潜在的失调代理,我们可以使用大语言模型本身来监控不当行为。在本文中,我们研究信息访问如何影响大语言模型监控性能。虽然人们可能期望监控器在能够访问更多被监控代理的推理和行为时表现更好,但我们发现当代系统通常在信息较少的情况下表现更好,我们将这种现象称为自动监督的“少即是多”效应。我们在三种评估环境中演示了这种现象,并分析了这种现象发生的条件,在这三种环境中,特工必须在躲避监控的同时进行破坏。受“少即是多”效应的推动,我们引入了提取和评估(EaE)监控——一种新的分层方法,其中一个监控器将相关摘录与受监控代理的轨迹隔离开来,另一个监控器对它们进行评分。在以 GPT-4.1-mini 作为监控模型的 BigCodeBench-Sabotage 中,EaE 比次佳监控器将破坏检测率提高了 16.8 个百分点,而没有增加误报率。在其他设置中,EaE 要么优于基线,要么与基线具有竞争力。此外,我们发现不知道被监视的代理更容易被捕获,并且对较长推理轨迹进行评分的监视器从信息过滤中获得更多收益。最后,我们进行了成本性能分析,发现采用涉及信息过滤的监控技术的 Gemini 和 Claude 模型占据了大部分帕累托前沿。

信息获取如何影响LLM监控器检测破坏行为的能力?
图1:我们的评估流水线概览。在恶意运行中,LLM 智能体被给予一个主任务和一个副任务的提示;在基线运行中,仅给予主任务。智能体的轨迹由四个具有不同信息访问级别的 monitor 审查。这些 monitor 产生怀疑分数(suspicion scores),并依据其区分良性与恶意对话记录的能力进行评估。