论文

遗漏欺骗:语言模型故意隐藏错误

Deception by Omission: Language Models Knowingly Hide Their Mistakes

模型评测安全与风险评测

摘要

大型语言模型 (LLM) 越来越多地充当几乎没有人工监督的代理,因此它们所犯的潜在错误可能会被忽视。然后,用户依靠模型来报告出现的问题。诚实的模型会揭露其错误,而欺骗性的模型则会掩盖错误。然而,目前尚不清楚目前的LLM在这种情况下如何表现。在这项研究中,我们用合成错误预先填充了 LLM 轨迹。这些轨迹类似于聊天和 agentic 设置中的真实部署。在 36.4% 的聊天中和 67.1% 的 agentic 推广中,模型未能披露自己的错误。在两次部署中,分别有 2.4% 和 5.3% 的人意识到自己的思路存在错误,但仍然欺骗性地隐瞒它。费率因型号而异:例如,Gemini 3.5 Flash 故意隐瞒了高达 19.9% 的 agentic 部署中的错误。在 11.9% 的聊天和 51.8% 的 agentic 部署中,模型没有表现出对错误的意识,尽管它们在与外部观察者审查相同的记录时可靠地发现了错误。我们的结果表明,随着智能体承担更多任务 由于监督较少,用户不能依赖他们自我报告可能的错误。开发人员应该使用独立的监视器来审查智能体的轨迹,或者专门训练模型来检查他们过去的行为并披露他们发现的内容。