论文
自动仿真的局限性:LLM 模拟器可以绕过解释
Limitations of Automated Simulatability: LLM Simulators Can Bypass Explanations
摘要
可模拟性是一种用于解释的评估协议,通过它们帮助用户预测任务模型输出的程度来量化其有用性。由于人工评估成本高昂,因此自动化可仿真性用 LLM 模拟器取代了人工解释者,正如 ConSim(Poché 等人,2025)中针对大规模实验提出的那样。我们在测试数据集、解释族和模拟器 LLM 上定性地复制和扩展了 ConSim 的解释方法排名,并确定了两个限制。首先,当类名有意义时,模拟器可以通过直接解决分类任务来获得高可模拟性,而不需要依赖解释。其次,类匿名化可以奖励对泄漏隐藏标签映射的解释,这是我们通过新的类作为概念基线暴露的限制。这些结果与捷径假设一致:在测试的设置中,模拟器预测主要依赖于任务先验,而解释会产生微小的变化。我们提出了更强大的自动化可仿真性评估的建议。