论文

法律领域推理中大语言模型的神经元水平分析

Neuron Level Analysis of Large Language Model in Legal Domain Reasoning

模型评测模型行为与机制分析

摘要

我们对 LLM 中的法律领域推理进行了神经元级分析,并将其与七个开放权重模型中的其他应用领域任务进行了比较。使用神经元归因分数对有影响的神经元进行排序和抑制,我们证实抑制已识别的神经元会降低目标任务的准确性,而抑制相同数量的随机神经元则不会。我们进一步发现一小部分神经元对所有七项任务都有影响;一旦这些神经元被移除,抑制剩余的神经元只会降低它们被识别的任务,从而在每个研究的模型中揭示真正的任务特异性神经元。在法律领域内,三个基准表现出相对较高的神经元重叠,并且往往受到共同影响,表明法律成分神经元跨越司法管辖区。我们实验中识别出的神经元的分布表明,有影响力的神经元集中在中间 MLP 层的假设可能取决于输入格式和内容,而不是普遍现象。