论文

大语言模型 生成文本的嵌入式条件独立性测试及其在德国议会演讲中的应用

Embedded Conditional Independence Tests for Large Language Model Generated Text with an Application to German Parliament Speeches

模型评测评测方法与指标

摘要

条件独立性测试 (CIT) 在给定第三个随机对象 $Z$ 的情况下测试两个随机对象 $X$ 和 $Y$ 之间的条件依赖性。现有的 CIT 对高维数据的适用性有限,尤其是文本等多模态数据。然而,我们表明此类测试对于 大语言模型 (LLM) 输出很有意义,我们测试从源文本 $Z$ 生成的输出 $X$ 是否携带超出 $Z$ 本身的属性 $Y$ 的信息。为此,我们提出嵌入式 CIT (eCIT),它嵌入 $X$ 和 $Z$ 并将现有的 CIT 应用于结果表示和 $Y$。我们证明,只要 $Z$ 的嵌入足够,即保留 $Z$ 携带有关 $Y$ 或 $X$ 表示的信息,零假设从 $X$ 和 $Z$ 转移到它们的表示,因此对嵌入假设有效的 CIT 对原始假设也有效。我们进一步给出了两个假设的等价条件,并表明当嵌入测试以条件均值独立性为目标时,充分性减弱为均值充分性。我们提出了一种半合成模拟设计,用于评估特定数据集和任务上给定嵌入图的 I 型错误 (T1E) 控制和 eCIT 的能力,并使用它在我们的应用程序中评估它们。将 eCIT 应用于德国议会演讲,我们发现对于所有嵌入图组合,两个 LLM 的摘要包含有关演讲者派系和性别的信息,超出了生成演讲的范围。