论文
PTP:基于先前标记预测的 LLM 反演,用于近乎精确的快速重建
PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction
摘要
大语言模型 (LLM) 通过自动回归采样下一个标记来生成文本。这本质上会导致提示和响应之间的多对多映射,从而使从观察到的输出推断提示的任务变得复杂。先前对 LLM 反演帧的工作提示将恢复作为语义重建任务。他们依靠在大型外部数据集上预训练的 微调 序列到序列模型(并且需要访问模型权重或 logits)来生成语义上合理的提示。相比之下,我们提出了一种在黑盒设置中反转给定 LLM 的功能方法,无需辅助工具。我们完全从头开始使用目标 LLM 本身综合生成的数据训练显式逆语言模型。与前向下一个词元预测类似,我们的逆模型是使用前一个词元预测进行训练的,在前向和逆向过程之间建立生成链接,从而实现忠实的快速重建。此外,它自然地支持通过采样进行不同的提示重建,所有这些提示都会在前向目标 LLM 下引起类似的响应。我们的方法跨数据集进行概括,并在根据不同 LLM 生成的响应重建提示时表现出可转移性。此外,在用于提示和响应重建的一组基于词元的评估指标中,我们的方法优于之前的工作。