论文

生成语言模型的归因契约

The Attribution Contract for Generative Language Models

模型评测模型行为与机制分析

摘要

特征归因根据输入的每个部分对模型输出的解释程度来对其进行评分。我们认为,在生成语言模型中,这些分数没有固定的含义。分类器只有一个输出需要解释,但生成模型逐个生成其输出标记,每个生成的标记既是输出又是输入,因此解释输出变成了几个不同的问题。我们通过提出归因契约来支持这一主张,该契约是一个将问题命名为一组归因分数答案的框架。合同指定了正在解释的模型分数、固定的内容、目标输出、生成过程以及哪些特征可以接受归因、实践中重要的选择。例如,符合条件的特征决定分数解释的内容:在本地下一个词元合约下,模型自己生成的词元接收归因质量的 $29\%$,与输入问题上的 $25\%$ 相当,并将其解读为提示级解释是一个错误,我们将其称为自我归因谬误。生成过程还塑造特征归因:在专家混合模型上,集成梯度完整性是不可靠的,因为沿着归因路径重新计算专家路由会留下一个大的残差,使路由固定大大降低,而掩蔽扩散模型在生成时固定其选择,其残差反而随着步骤的增加而减小。这些结果表明,在提出和评估生成语言模型的归因方法时应仔细指定归因契约,因为归因的含义和评估取决于其解释设置。