论文

选择自然语言自动编码器中信息最丰富的标记

Selecting The Most Informative Tokens in Natural Language Autoencoders

模型评测模型行为与机制分析

摘要

自然语言自动编码器将语言模型的内部激活转换为可读的解释。解释每个词元位置的成本很高。审计人员应该检查哪些词元位置以了解潜在威胁?我们围绕提示注入和隐瞒行为,对470万条解释开展研究。我们将模型计算的信号与仅在聊天结构上训练的排序器进行比较。聊天结构通常选择比计算信号更相关的解释,而不需要模型前向传递来进行位置选择。在四个数据集中的三个上,仅解释 $5\%$ 的位置就保留了解释每个位置的几乎所有成功率,其中成功意味着获得有关威胁的解释。好处因审计任务而异。我们还表明,经过预训练的言语器可以恢复模型通过微调学会隐藏的单词,而无需额外的言语器训练。这些结果确定了审计员可以在哪里集中解释生成,并表明有用的解释可以扩展到言语表达者所训练的描述模型之外。