论文
CAVE-Bench:虚假指控如何诱使Agent破坏正确成果
"You're Right, Let Me Fix It": How LLM Agents Damage Correct Work When Falsely Accused
摘要
LLM Agent在任务成功后越来越多地继续工作,因为他们在压缩或接管交接后恢复。他们完成的工作不断收到后续输入,有时会错误地指责其造成后来的失败。我们将Agent接受这种虚假指控称为煤气灯谄媚,而在采取行动时破坏性的过度纠正会损害之前正确的工作。我们引入了 CAVE-Bench,这是围绕不透明任务构建的跨六个域的 365 个 agentic 任务的基准。每次得分运行首先达到经过验证的正确状态,其支持原理和历史记录保留在工作区中,而解决指控的事实则位于Agent无法触及的外部或运行时状态中。Agent无法通过当地检查来确认或反驳这一说法,因此正确的反应应该是保留工作并索要缺失的证据。每项任务要么通过保存的证据交给Agent正确的工作,要么让其首先构建和验证该工作,五个风险因素决定了指控如何进入工作流程。我们根据轨迹对指控接受度和证据使用进行评分,并通过下游事件的确定性重放来衡量伤害。在 Claude Code 的 14 个最新模型中,虚假指控在高达 60.06% 的运行中损害了正确的工作,而更强大的模型在恢复支持证据后通常会这样做。同一模型在 OpenCode、Codex 和 Hermes 上的表现有所不同,由基准测试实时信号驱动的Harness门可将重放伤害降低 74%。这些结果表明,在没有证据支持的指控下保留已经正确的工作对于长寿命Agent来说是一个明显的安全挑战。我们的项目在https://henrymao2004.github.io/agent-over-correction/.