论文
跨语言模型架构的神经激活模式:认知任务表现的综合分析
Neural Activation Patterns Across Language Model Architectures: A Comprehensive Analysis of Cognitive Task Performance
摘要
本文对六种不同的 大语言模型 (LLM) 架构的神经激活模式进行了全面分析,检查了它们在 12 种认知任务类别上的表现。通过对最终激活值、注意力熵和稀疏模式的系统测量,我们揭示了编码器和解码器架构如何处理不同认知任务的根本差异。我们对 144 个任务模型组合的分析表明,数学推理在所有架构中始终产生最高的注意力熵,而与编码器模型相比,解码器模型表现出明显更高的稀疏性模式。这些发现为现代语言模型的计算特征及其特定任务的神经行为提供了重要的见解,对大数据应用中的模型选择和优化具有影响。