论文
操纵裁判:不忠实的思维链可破坏智能体评估
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
摘要
大语言模型(LLM)日益被用作裁判来评估智能体表现,尤其是在判断依赖包含思维链(CoT)推理的智能体轨迹的不可验证场景中。这一范式隐含假设智能体的 CoT 忠实反映其内部推理与底层环境状态。我们证明这一假设是脆弱的:LLM 裁判极易受到智能体推理轨迹操纵的影响。通过在保持动作与观察不变的情况下系统改写智能体 CoT,我们证明仅操纵推理就能使最先进 VLM 裁判的误报率在横跨多样网页任务的 800 条轨迹上最多膨胀 90%。我们研究了从只改变推理呈现方式的风格类策略,到伪造任务进展信号的内容类策略等操纵手段,发现内容类操纵始终更有效。我们评估了基于提示的技术与扩展裁判时计算,它们能减少但不能完全消除对操纵的易感性。我们的发现揭示了基于 LLM 评估的根本脆弱性,并强调需要能对照可观察证据验证推理声明的裁判机制。
