论文
按扰动强度评估 LLM 解释自洽性
Enhancing Assessment of Self-Consistency in LLM Explanations using Perturbation Strength
摘要
之前的工作已经使用表面扰动方法检验了大语言模型生成的解释的自洽性。然而,这些扰动的强度没有明确测量和控制。在这项工作中,我们提出了一种 LLM 作为法官的方法,以统一的方式测量输入和 CoT 扰动的扰动强度。然后,我们评估在受控强度条件下各种大语言模型生成的解释的自我一致性,确保对扰动类型进行公平比较。实验表明,我们提出的基于 LLM 的扰动强度测量优于其他基于嵌入和概率的方法,并且输入扰动通常比 CoT 扰动对 LLM 的影响更大。我们的工作表明,只有在相同的扰动类型下,对模型自洽性的判断才是公平的。
