论文

Transformer 语言模型中的选择性神经元放大

Selective Neuron Amplification in Transformer Language Models

模型评测模型行为与机制分析

摘要

大语言模型 经常在他们似乎已经理解的任务上失败。在我们的实验中,这似乎不是因为知识缺失,而是因为在推理过程中某些内部电路没有被强烈激活。我们探索选择性神经元放大,它可以在不改变模型参数的情况下增加任务相关神经元的影响。该方法在推理时起作用,不会永久改变模型。 SNA 主要在模型不确定时有帮助,而在模型已经有信心时效果较低。这表明一些模型失败是由于激活较弱而不是缺乏能力造成的。