论文

超越余弦相似性重新思考 大语言模型 中的层相关性

Rethinking Layer Relevance in Large Language Models Beyond Cosine Similarity

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 彻底改变了自然语言处理。了解其内部机制对于开发更具可解释性和优化的架构至关重要。机械可解释性导致了评估层相关性的各种方法的发展,其中余弦相似度是该领域广泛使用的工具。在这项工作中,我们证明了余弦相似度不能很好地代表因层移除而导致的实际性能下降。我们的理论分析表明,一个层可以表现出任意低的余弦相似度分数,同时仍然对模型的性能至关重要。另一方面,来自一系列 LLM 的经验证据证实,余弦相似度与实际性能下降之间的相关性通常较弱或中等,从而导致对 Transformer 内部机制的误导性解释。我们提出了一个更稳健的指标来评估层相关性:由于删除层而导致模型精度的实际下降。尽管这是一个计算成本高昂的指标,但这种方法提供了更准确的层重要性图,允许更明智的修剪策略和轻量级模型。我们的研究结果对可解释的 LLM 的开发具有重要意义,并强调在评估层相关性时需要超越余弦相似性。