论文

特工集体不应发现自己的冒名顶替者:国际象棋案例研究

Agent Collectives Should Not Detect Their Own Imposters: A Chess Case Study

模型评测安全与风险评测

摘要

协作执行某项任务的人工智能代理集体有可能超越该任务的任何单个代理。我们研究此类集体针对可能的冒名顶替者(即故意试图误导同行的代理人)的稳健性。由于单个冒名顶替者可能会破坏集体的优势,因此我们需要检测到他们。我们考虑两种策略:(i)将冒名顶替者检测纳入参与代理中,或(ii)在集体之外使用专用的冒名顶替者检测器。我们在 Gambit 上进行了实证研究,Gambit 是一个测试平台,其中 4 个推理代理对国际象棋的走法进行深思熟虑。虽然设置虽小,但对于前沿模型来说仍然具有挑战性。国际象棋允许对使用集体的收益和冒名顶替者造成的损害进行客观、定量的评估(通过最先进的国际象棋引擎)。我们发现,仅仅警告代理人潜在的冒名顶替者的存在是没有好处的:当不存在冒名顶替者时,它会降低决策的质量,引发从自责到替罪羊的各种反应,夸大词元的使用,并向冒名顶替者揭示它是如何被发现的。因此,我们推荐一个检测器,它可以读取集体的商议,但从不加入,只返回裁决。这样的检测器必须在很少的例子之后重新校准新的攻击策略,而不是等待完全的重新训练。在我们的基准测试中,具有元训练分类头的 3B 语言模型实现了以下目标:20 个标记示例的单个梯度步骤足以适应看不见的冒名顶替者策略。在匹配的零样本精度下,该检测器的自适应增益是标准微调的 8 倍,而训练成本却降低了 14 倍。我们发布了 Gambit 基准,其中包含 37,352 个标记的审议,涵盖 240 个进化的冒名顶替者策略。代码和数据:https://anonymous.4open.science/r/gambit。