论文
可解释性智能体评估中的陷阱
Pitfalls in Evaluating Interpretability Agents
摘要
自动化可解释性系统旨在减少对人工的需求,并将分析扩展到越来越大的模型与多样的任务。朝这一目标的近期努力以不断提高的自主程度利用大语言模型(LLM),从固定的一次性工作流直到完全自主的可解释性智能体。这一转变带来了相应的需求:评估方法也要随之扩展,以跟上所生成解释的数量与复杂度。我们在自动化电路分析的背景下研究这一挑战,即解释模型组件在执行特定任务时所扮演的角色。为此,我们构建了一个智能体系统,其中研究智能体迭代地设计实验并精炼假设。在与文献中六项电路分析任务的人类专家解释对照评估时,该系统看起来颇具竞争力。然而,更细致的审查揭示了基于复现的评估的若干陷阱:人类专家解释可能主观或不完整,基于结果的比较会遮蔽研究过程,而基于LLM的系统可能通过记忆或有依据的猜测复现已发表的发现。为解决其中一些陷阱,我们提出一种基于模型组件功能可互换性的无监督内在评估。我们的工作展示了评估复杂自动化可解释性系统的根本挑战,并揭示了基于复现的评估的关键局限。
