论文
你的logits知道什么?(答案可能出人意料!)
What do your logits know? (The answer may surprise you!)
摘要
近期工作表明,探测模型内部可以揭示大量从模型生成结果中看不出来的信息。这带来了无意或恶意信息泄露的风险:模型用户能够获知模型所有者以为不可访问的信息。我们以视觉-语言模型为试验台,首次系统比较了信息在从残差流中编码的丰富信息经由两个自然瓶颈被压缩的过程中,在不同「表征层级」上保留的情况:这两个瓶颈分别是利用tuned lens得到的残差流低维投影,以及最可能影响模型答案的最终top-k logits。我们证明,即使是由模型top logit值定义的、易于获取的瓶颈,也会泄露基于图像的查询中存在的与任务无关的信息,某些情况下泄露的信息量与完整残差流的直接投影一样多。
