论文

迈向语言模型潜在技能的引导与优化:一项实证研究

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

模型评测模型行为与机制分析

摘要

技能作为大语言模型 (LLM) 程序功能的有用抽象,捕获模型如何执行结构化、多步骤推理和程序执行。现有方法通常将技能视为通过提示或程序指定的显式、表面级构造,从而留下了这样的问题:如何在模型内表示这些程序能力以及它们是否可以作为潜在空间中的结构化对象进行操作。在这项实证研究中,我们研究了程序性 LLM 技能是否可以表示为激活空间中的方向,以及这些方向上的向量空间操作是否可以表达技能水平行为。我们发现程序技能承认向量空间表示:可以激活个人技能方向来改变模型行为;独立提取的方向可以组合形成更高级别的技能。对比方向产生上下文条件的算法个性化,并且技能方向的优化轨迹非单调地演变,中间状态通常超越完全优化的解决方案。这些结果支持了程序性LLM技能的代表性观点:它们承认潜在的向量空间组织,允许通过内部干预进行直接操作。

迈向语言模型潜在技能的引导与优化:一项实证研究:论文配图
图1:作为代表级别对象的远程大语言模型技能。我们研究在激活空间中技能条件方向的四种可观测特性:可控性、构成、个性化和进化。