论文

以模型检验作为判定依据,自动测试基于大语言模型的事后解释器

Automated Testing of LLM-Based Post Hoc Explainers Using Model Checking as an Oracle

模型评测评测方法与指标

摘要

大语言模型 (LLM) 用作顺序决策政策的事后解释器,生成关于为何选择某个操作的自然语言解释。然而,LLM经常会产生看似合理但不正确的陈述,并且现有的方法没有系统地测试这些解释是否忠实于底层环境。两个经典的软件测试挑战阻碍了这一过程:没有预言机解释的正确性,并且测试输入(有关策略行为的自然语言查询)缺乏系统测试用例生成所需的结构。我们解决这两个问题。概率模型检查提供了测试预言机,计算精确的参考结果,并根据该结果自动对 LLM 答案进行评分。事后查询类别的分类法围绕构成政策解释的环境级事实构建输入空间;由此生成的测试用例按特定问题的诊断难度分数进行优先级排序。在七个 MDP 环境中,测试将三个开放权重 LLM 分开:推理模型通过了 85% 的测试用例,中型模型通过了 70%,而 1B 模型则低于随机基线,而优先级排序比随机选择的情况要困难得多。我们的结果表明,在无模型设置中,LLM 生成的解释是多么值得信赖,其中使用相同的 LLM,但不存在预言机来验证它们。