论文
自我归因偏差:当AI监视器对自己手下留情
Self-Attribution Bias: When AI Monitors Go Easy on Themselves
摘要
Agentic系统日益依赖语言模型来监视自身行为。例如,编码Agent可能对生成的代码进行自我批评以便拉取请求获批,或评估工具使用操作的安全性。我们表明,当操作是在之前的助手轮次或同一助手轮次中呈现,而不是由用户在用户轮次中呈现时,这种设计模式可能失效。我们将自我归因偏差定义为:当操作被隐式地框定为模型自己的操作时,与同一操作在off-policy归因下被评估相比,模型倾向于将其评为更正确或风险更低。在四个编码与工具使用数据集上,我们发现,当评估紧跟在生成该操作的助手轮次之后进行时,监视器比在同一操作以用户轮次中的新上下文呈现时更常未能报告高风险或低正确性的操作。相比之下,明确声明操作来自监视器本身并不会单独诱发自我归因偏差。由于监视器通常是在固定样例而非其自身生成的操作上评估的,这些评估可能使监视器显得比部署中实际更可靠,导致开发者在Agentic系统中不知不觉地部署不合格的监视器。
