论文

纠正影响:使用正交潜在空间拆箱 LLM 输出

Correcting Influence: Unboxing LLM Outputs with Orthogonal Latent Spaces

模型评测模型行为与机制分析

摘要

在医疗保健领域可靠使用 大语言模型 (LLM) 的关键一步是将预测归因于其训练数据,类似于医学案例研究。这需要 词元级 精度:不仅查明哪些训练示例影响决策,还查明其中的哪些标记负责。虽然影响函数为此提供了一个原则框架,但之前的工作仅限于自回归设置,并且依赖于词元独立性的隐含假设,导致其识别的影响不可靠。我们引入了一个灵活的框架,通过一般预测任务的潜在中介方法来推断 词元级 的影响。我们的方法将稀疏自动编码器附加到预训练的 LLM 的任何层,以学习近似独立的潜在特征的基础。与先前的影响力在词元之间相加分解的方法不同,对潜在特征计算的影响力本质上是不可分解的。为了解决这个问题,我们引入了一种使用雅可比向量积的新方法。 词元级 影响力是通过词元激活模式将潜在属性传播回输入空间来获得的。我们使用有效的逆 Hessian 近似来扩展我们的方法。医学基准实验表明,我们的方法可以识别稀疏的、可解释的标记集,这些标记集共同影响预测。我们的框架增强了信任并支持模型审计,推广到需要透明和负责任的决策的高风险领域。