论文

从隐藏状态恢复输入文本:仅解码器语言模型的基于梯度的反演研究

Recovering Input Text from Hidden States: Study of Gradient-Based Inversion of Decoder-Only Language Models

模型评测模型行为与机制分析

摘要

这项工作研究隐藏状态反转问题:从最后一层隐藏状态恢复仅解码器语言模型的原始输入标记序列。我们没有将反演视为一次性重建,而是将其研究为一种连续的嵌入空间优化,其中在搜索期间将软代理驱动到泄漏目标,而无需任何硬词元投影,并且在内循环结束时仅提交一次词元。这种设计选择有两个后果,这是本文的主要焦点。首先,将优化完全保持在连续空间中会暴露出一组丰富的内部信号:真值 词元的排名轨迹、每个位置的损失曲线以及在提交时测量的离散损失。其次,离散损失允许通过累积离散损失来评估恢复的正确性。我们进一步分析哪些标记破坏了重建,并发现了明显的分类不对称性:嵌入矩阵密集区域中的空格前缀、高频功能词主导了失败,而承载内容的标记几乎完美地恢复了。在 10 个标记的 C4 上,随着候选窗口的扩大,精确匹配率从 66.9% 上升到 97.5%(平均相似度 0.994),这证实大多数错误是可恢复的未遂错误,而不是真正的歧义。与已发布的 SIPIT 参考文献进行比较后发现:每步硬投影速度更快,但连续公式使得优化可观察且故障可检测。结果表明,GPT-2 的最后一层隐藏状态与原始文本一样敏感。