论文

LLM如何遵循指令:娴熟的技能协作而非通用机制

How LLMs Follow Instructions: Skillful Coordination, Not a Universal Mechanism

模型评测模型行为与机制分析

摘要

人们通常认为指令微调赋予语言模型一种跨领域的通用指令遵循能力,但其底层机制仍知之甚少。指令遵循依赖的是一种通用机制,还是组合式的技能调用?我们在三个指令微调模型上,跨九项多样任务开展诊断性探测来研究这一问题。我们的分析提供了反对通用机制的汇聚证据。首先,跨所有任务训练的通用探测器始终不及任务专用探测器,表明表征共享有限。其次,跨任务迁移微弱,且按技能相似性呈聚类分布。第三,因果消融揭示出稀疏且不对称的依赖关系,而非共享表征。各任务还按复杂度在层间分层,结构性约束在浅层即显现,语义性任务则出现较晚。最后,时序分析表明约束满足是在生成过程中以动态监控的方式运作,而非生成前的规划。这些发现表明,指令遵循更宜刻画为对多样化语言能力的娴熟协作,而非某个单一抽象约束检查过程的调用。

LLM如何遵循指令:娴熟的技能协作而非通用机制:论文配图
(a) (b) 图 2:(a) 跨任务泛化:单元格 (i,j)(i,j) 显示任务 ii 数据上的探测 jj 准确性。 (b) 归一化精度下降:单元格 (i,j)(i,j) 显示通过零空间投影删除探针 jj 信息后探针 ii 的性能下降。颜色越深表示依赖性越强。全程使用最好的线性探头。