论文

分解提示如何引导行为

Decomposing how prompting steers behavior

模型评测模型行为与机制分析

摘要

提示在没有权重更新的情况下引导大型语言模型(LLM)和视觉语言模型(VLM),但目前尚不清楚指令变化如何重塑内部表征以产生行为。我们引入了一个嵌套的几何分解框架,它将提示视为提示后内容的表征几何的转换。对于每个提示对,我们使用越来越富有表现力的刺激不变图来对齐两个提示下相同刺激的表示:平移、均匀缩放的刚性变换、顺序轴缩放、仿射变换和非线性变换。然后,我们通过用映射的对应物替换单层的提示 A 隐藏状态来测试每个图,并测量提示 B 表征几何和行为的恢复。跨越三个 LLM、三个 VLM 和六个涵盖风格、情感、场景内容和数字的文本或图像数据集,提示不断地重塑表征以适应指示的任务结构。交叉验证的方差分解表明,许多提示引起的激活变化是通过形状保持映射捕获的,特别是具有统一缩放的平移和刚性变换,而层配置文件揭示了跨层的特定于模型和任务的路由策略。至关重要的是,尽管翻译和刚性层已经改善了行为一致性,但仿射变换是几乎恢复目标提示任务几何形状并产生相应行为收益的第一层。这表明跨维度线性混合是一种关键机制,通过它可以促使重组表示朝着指示的任务结构发展。我们的框架将提示引起的表征变化分解为可解释的几何组件,并揭示模型如何路由任务相关结构以产生提示驱动的行为。

分解提示如何引导行为:论文配图
图 1:(a) 两个提示 AA(“有人吗?”)和 BB(“有多少人?”)与刺激集 𝒮\mathcal{S} 一起呈现给同一模型。我们利用单个变压器层 ℓ\ell(突出显示)的隐藏状态来获得层ℓ\ell流形 ℳA=ΦA​(𝒮)\mathcal{M}^{A}=\Phi^{A}(\mathcal{S})(绿色)和ℳB=ΦB​(𝒮)\mathcal{M}^{B}=\Phi^{B}(\mathcal{S})(紫色)。相同的前向传递继续经过 ℓ\ell 并产生每个刺激的特定于提示的输出(“是/否”与计数)。我们询问系统映射 f:ℳA→ℳBf:\mathcal{M}^{A}\to\mathcal{M}^{B} 是否存在,它必须有多复杂,以及它是否因果驱动行为。 (b) 随归一化层深度而变化的提示引起的表征变化。每条灰色曲线是来自三个文本数据集上的三个LLM(OPT-2.7B、Llama3-8B、Qwen3-8B)和三个图像数据集上的三个VLM(BLIP-2、LLaVA-OneVision、Qwen3-VL)的一对模型和数据集;黑色曲线是它们的平均值。在早期层 (10−410^{-4}–10−210^{-2}) 中变化很小但不为零,并且随着深度几乎单调增长,在顶部达到 10−110^{-1}–10010^{0},在架构和模式之间具有一致的形状。