论文

LayerTracer:适用于任意 大语言模型 架构的联合任务粒子和漏洞层分析框架

LayerTracer: A Joint Task-Particle and Vulnerable-Layer Analysis framework for Arbitrary Large Language Model Architectures

模型评测模型行为与机制分析

摘要

目前,大语言模型(LLM)具有多元化的架构景观,包括传统的Transformer、GateDeltaNet和Mamba。然而,各种LLM架构中的层次表示、任务知识形成位置和网络鲁棒性瓶颈机制的演化规律仍不清楚,这给混合架构设计和模型优化带来了核心挑战。本文提出了 LayerTracer,一种与任何架构无关的端到端分析框架,与任何 LLM 架构兼容。通过逐层提取隐藏状态并将其映射到词汇概率分布,实现任务粒子定位和层漏洞量化的联合分析。我们将任务粒子定义为目标词元概率首次显着上升的关键层,代表模型的任务执行起点,将脆弱层定义为掩模扰动前后输出分布之间具有最大Jensen-Shannon(JS)散度的层,反映其对干扰的敏感性。对不同参数尺度模型的实验表明,无论参数大小如何,任务粒子主要出现在模型的深层,而较大参数的模型表现出更强的层次鲁棒性。 LayerTracer为混合架构的层划分、模块配比、门控切换等提供科学依据,有效优化模型性能。准确定位任务有效层和稳定性瓶颈,为LLM结构设计和可解释性研究提供普遍支持。