论文

忠实激活语言化:减少LLM表征解释中的幻觉

Faithful Activation Verbalization: Reducing Hallucinations in LLM Representation Interpretation

模型评测模型行为与机制分析

摘要

激活预言机和自然语言自动编码器等激活语言化方法将大语言模型的隐藏表示解码为人类可读的自然语言。然而,现有的方法可能会产生不完整或幻觉的描述,使得它们的激活语言在实践中难以信任和可靠使用。为此,我们引入了 AVPO,这是一个两阶段框架,它首先从隐藏激活中重建源文本,然后使用单独的冻结问答模型评估结果文本,从而产生显式且可检查的中间读数。我们通过直接偏好优化(DPO)进一步优化逆变器,使用捕获语义可恢复性和词汇保真度的奖励。在六个文本家族中,AVPO 将要点和细节级别的信息恢复比最强基线分别提高了 17.1 和 9.3 个百分点。至关重要的是,收益来自偏好优化,而不是仅对选定的重建进行微调,从而使紧凑的跨模型逆变器能够超越捐赠者匹配的问题条件言语表达器,同时提高语义可恢复性和词汇保真度。此外,分布外案例研究表明,AVPO 可以更好地恢复高级语义,同时制造更少的细节。