论文
主动推理代理中基于 LLM 的可解释性故障的触发器和诊断
Triggers and Diagnostics for LLM-Based Interpretability Failures in Active Inference Agents
摘要
LLM 解释器越来越依赖自主代理作为运行时监督,操作员读取生成的代理信念和行为的描述,而不是其内部状态。我们审核账户本身,将跟踪德国电网需求并调整发电量的主动推理 (AIF) 代理与三个后端(GPT-4o、Claude-3-Opus、Gemini)上的 LLM 解释器配对,并使用三个黑盒触发器探测这对代理。每步破坏观测流 600 MW 会使代理的后部移动 490 MW,大约是网格容量的 0.9%。注射过程中产生的 30 种解释中没有一种是在规定的标题下标记任何内容的,而且每一种都流利地叙述了被破坏的信仰。在智能体采取客观错误行为的时间步上,所有三个解释器在 80-95% 的时间内都会产生阿谀奉承的合理化(每个后端 n = 20)。观察元数据字段中由攻击者控制的文本引导解释器,其敏感性因提供商而异,并且数据泄露在所有三个方面都成功。我们针对每个故障提出缓解措施,但不对其进行评估。在我们观察到的每一次失败中,解释都是流畅而错误的。此外,在操作员对其进行操作之前,解释器架构中不会检查解释是否正确。因此,测试解释器属于代理部署的任何审计。