论文

Hodoscope:面向AI不当行为的无监督监测

Hodoscope: Unsupervised Monitoring for AI Misbehaviors

模型评测安全与风险评测

摘要

现有的AI智能体监测方法依赖有监督评估:人工编写的规则或基于LLM的裁判,用于检查已知的失败模式。然而,新型不当行为可能完全落在预定义类别之外,且基于LLM的裁判可能不可靠。为解决这一问题,我们类比无监督学习,提出无监督监测的形式化定义。无监督监测器并不检查特定不当行为,而是在不对何为问题行为做先验假设的前提下,协助人类发现智能体的问题行为,并把这一判断留给人类。我们观察到问题行为往往独具特征:利用基准漏洞的模型会表现出正常基线中不存在的动作,而某一评测特有的漏洞会在同一模型跨多个基准运行时表现为行为异常。这促使我们将群体间行为差异作为无监督监测的主要信号。我们提出Hodoscope,一个将这一洞见付诸实践的工具。Hodoscope比较各群体间的行为分布,标出独特且可能可疑的动作模式供人工审查。借助Hodoscope,我们在Commit0基准中发现一个此前未知的漏洞(未压缩的git历史使真实答案可被还原,至少虚增了五个模型的分数),并在ImpossibleBench与SWE-bench上独立复现了已知漏洞利用。定量评估估计,与朴素的均匀采样相比,我们的方法将审查工作量降低6-23倍。最后,我们表明通过Hodoscope发现的行为描述可以提升基于LLM裁判的检测精度,展示了从无监督监测通往有监督监测的路径。

Hodoscope:面向AI不当行为的无监督监测:论文配图
图 1:Hodscope 是一种用于无监督监控的工具。代理轨迹被分解为单独的动作,进行汇总以抽象出特定于任务的细节,嵌入并投影为 2D。密度差异叠加(红色区域)突出显示了一组相对于其他组中代表性过高的行为。人类检查各个点以检查潜在的行为并确定该行为是否可疑。