论文
大语言模型中的提升状态假设
Lifted State Hypothesis in Large Language Models
摘要
大语言模型(LLM)经微调与上下文学习快速适应,但它们把哪些输入视为同一情形、其预测为何一同改变,仍不清楚。我们提出提升状态假设:在固定模型参数、上下文范围与目标计算下,在可观察的计算相关行为上不可区分的样本构成一个计算相对类型。我们假设:兼容的情景会激活一个可复用的潜在组件——提升状态——支撑目标计算。状态复用使类型级泛化成为可能,但制造了一个非单调修订问题:当后续证据区分出一个子类型时,修订仍与父类型共享的状态,可能影响那些预测本不应改变的成员。模型必须经重路由、新状态或输入特定补偿来分离子类型。我们形式化泛化与修订之间的这一关系,并引入NMR-Type数据集评估LLM:数据集先支持一个广泛的模运算规则,随后在一个被扣留的子类型上提供冲突监督、同时重放先前样例。跨全量微调、LoRA与上下文学习,模型常把广义规则泛化到子类型,却无法定位其后的修订。这些结果提供与该假设一致的行为证据,并推动对提升状态形成与修订的进一步研究。
