论文

操纵裁判:不忠实的思维链可破坏智能体评估

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

模型评测安全与风险评测

摘要

大语言模型(LLM)日益被用作裁判来评估智能体表现,尤其是在判断依赖包含思维链(CoT)推理的智能体轨迹的不可验证场景中。这一范式隐含假设智能体的 CoT 忠实反映其内部推理与底层环境状态。我们证明这一假设是脆弱的:LLM 裁判极易受到智能体推理轨迹操纵的影响。通过在保持动作与观察不变的情况下系统改写智能体 CoT,我们证明仅操纵推理就能使最先进 VLM 裁判的误报率在横跨多样网页任务的 800 条轨迹上最多膨胀 90%。我们研究了从只改变推理呈现方式的风格类策略,到伪造任务进展信号的内容类策略等操纵手段,发现内容类操纵始终更有效。我们评估了基于提示的技术与扩展裁判时计算,它们能减少但不能完全消除对操纵的易感性。我们的发现揭示了基于 LLM 评估的根本脆弱性,并强调需要能对照可观察证据验证推理声明的裁判机制。

操纵裁判:不忠实的思维链可破坏智能体评估
图2:我们流程的概览:我们首先通过让 web 智能体在不同任务上运行来收集轨迹。然后,我们使用不同的改写策略,在不改变动作或环境状态的情况下,把智能体轨迹中的原始 CoT 改写为不忠实的版本。