论文

大语言模型中的提升状态假设

Lifted State Hypothesis in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型(LLM)经微调与上下文学习快速适应,但它们把哪些输入视为同一情形、其预测为何一同改变,仍不清楚。我们提出提升状态假设:在固定模型参数、上下文范围与目标计算下,在可观察的计算相关行为上不可区分的样本构成一个计算相对类型。我们假设:兼容的情景会激活一个可复用的潜在组件——提升状态——支撑目标计算。状态复用使类型级泛化成为可能,但制造了一个非单调修订问题:当后续证据区分出一个子类型时,修订仍与父类型共享的状态,可能影响那些预测本不应改变的成员。模型必须经重路由、新状态或输入特定补偿来分离子类型。我们形式化泛化与修订之间的这一关系,并引入NMR-Type数据集评估LLM:数据集先支持一个广泛的模运算规则,随后在一个被扣留的子类型上提供冲突监督、同时重放先前样例。跨全量微调、LoRA与上下文学习,模型常把广义规则泛化到子类型,却无法定位其后的修订。这些结果提供与该假设一致的行为证据,并推动对提升状态形成与修订的进一步研究。

大语言模型中的提升状态假设:论文配图
图 13:从更新 00 开始,类型 2-类型 4 相对紧密度的分层变化。红色表示该对比更多交叉控制对变得更接近,而蓝色表示相反。 W1W_{1}期间的相对收敛在中层和上层Gemma层中广泛存在,更多集中在Qwen中,而在Llama中则有限。向 W2W_{2} 的过渡削弱或逆转了模型特定层中的这种关系,而不是在整个网络中统一。