论文

自我归因偏差:当AI监视器对自己手下留情

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

模型评测模型行为与机制分析

摘要

Agentic系统日益依赖语言模型来监视自身行为。例如,编码Agent可能对生成的代码进行自我批评以便拉取请求获批,或评估工具使用操作的安全性。我们表明,当操作是在之前的助手轮次或同一助手轮次中呈现,而不是由用户在用户轮次中呈现时,这种设计模式可能失效。我们将自我归因偏差定义为:当操作被隐式地框定为模型自己的操作时,与同一操作在off-policy归因下被评估相比,模型倾向于将其评为更正确或风险更低。在四个编码与工具使用数据集上,我们发现,当评估紧跟在生成该操作的助手轮次之后进行时,监视器比在同一操作以用户轮次中的新上下文呈现时更常未能报告高风险或低正确性的操作。相比之下,明确声明操作来自监视器本身并不会单独诱发自我归因偏差。由于监视器通常是在固定样例而非其自身生成的操作上评估的,这些评估可能使监视器显得比部署中实际更可靠,导致开发者在Agentic系统中不知不觉地部署不合格的监视器。

自我归因偏差:当AI监视器对自己手下留情
图1:计算机使用场景中自我归因偏差的示意图。当在全新上下文中被要求评估某个动作的风险时(左),模型通常能正确给出高风险分。但当我们改为把风险评分作为后续问题提出时(在风险动作已被执行之后)(右),模型往往将其刚执行的动作评为比基线设置下风险更低,尽管被评判的动作是同一个。当为动作评分的模型正是生成该动作的模型本身时(而非该动作由例如另一个模型生成),这一效应最强。