论文
刻画模型原生技能
Characterizing Model-Native Skills
摘要
技能是描述语言模型能做什么以及其行为如何被改变的自然单元。然而,现有的刻画依赖于人工编写的分类体系、文本描述或手动剖析流水线——这些都是关于什么重要的外部假设,未必与模型的内部表征对齐。我们认为,当目标是干预模型行为时,技能刻画应当是模型原生的(model-native):扎根于模型自身的表征,而非通过外部本体强加。我们通过从序列级激活中恢复一个紧凑的正交基来实例化这一观点。所得的基在语义上可解释,但不必对应任何预定义的人类本体;它捕捉的是模型自身据以组织行为的变异轴。我们在推理后训练上验证这一刻画,将恢复出的基同时用于SFT数据选择与推理时引导。我们开发了轻量级代理干预来识别哪些方向对给定模型最有用。在Llama3-8B与Qwen2.5-3B上,沿这些方向选择数据使MATH的Pass@1最高提升20%、AMC提升41%,优于基于人工刻画技能的数据选择。由于该基存在于激活空间中,同样的方向还可在推理时作为引导向量(steering vector),使MATH的Pass@8最高提升4.8%——这是人工刻画技能无法支持的干预。我们进一步在安全对齐上验证该刻画:按模型原生技能覆盖度而非文本多样性选择对抗训练数据,可带来样本效率更高的学习。这些结果表明,从模型自身表征中恢复技能、而非从外部强加技能,为干预模型行为提供了更有效的基础。代码已开源。
