论文

使用探针定向归因本地化 大语言模型 中的提示歧义

Localizing Prompt Ambiguity in Large Language Models with Probe-Targeted Attribution

模型评测模型行为与机制分析

摘要

提示歧义是 大语言模型 失败的常见原因,但很难本地化,因为它是提示的潜在属性,而现有的归因方法旨在解释可观察的输出,例如 logits 或生成的标记。我们引入 PRIG,一种梯度归因方法,它使用探针 logits 将潜在的歧义归因于标记位置。具体来说,PRIG 训练线性探针来区分清晰的提示和模糊的提示,并将探针得分归因于残留流中较早的标记表示。为了实现 词元级 评估,我们通过重写每个提示的一个任务关键句子来构建跨编码、数学和写作的综合歧义数据集,并用人工编写的人工参考标准对其进行补充。在此设置中,PRIG 比梯度归因基线更好地定位模糊跨度,在组合合成基准上实现 0.840 AUROC,在黄金集上实现 0.891 AUROC。它在句子级歧义识别方面也优于 GPT-5.4,并保留了域外的有用信号。这些结果使 PRIG 成为识别提示中哪些部分不明确的实用工具。更广泛地说,他们建议可以通过中间表示来本地化潜在提示属性,而不是通过输出级归因。