论文
分解提示如何引导行为
Decomposing how prompting steers behavior
摘要
提示在没有权重更新的情况下引导大型语言模型(LLM)和视觉语言模型(VLM),但目前尚不清楚指令变化如何重塑内部表征以产生行为。我们引入了一个嵌套的几何分解框架,它将提示视为提示后内容的表征几何的转换。对于每个提示对,我们使用越来越富有表现力的刺激不变图来对齐两个提示下相同刺激的表示:平移、均匀缩放的刚性变换、顺序轴缩放、仿射变换和非线性变换。然后,我们通过用映射的对应物替换单层的提示 A 隐藏状态来测试每个图,并测量提示 B 表征几何和行为的恢复。跨越三个 LLM、三个 VLM 和六个涵盖风格、情感、场景内容和数字的文本或图像数据集,提示不断地重塑表征以适应指示的任务结构。交叉验证的方差分解表明,许多提示引起的激活变化是通过形状保持映射捕获的,特别是具有统一缩放的平移和刚性变换,而层配置文件揭示了跨层的特定于模型和任务的路由策略。至关重要的是,尽管翻译和刚性层已经改善了行为一致性,但仿射变换是几乎恢复目标提示任务几何形状并产生相应行为收益的第一层。这表明跨维度线性混合是一种关键机制,通过它可以促使重组表示朝着指示的任务结构发展。我们的框架将提示引起的表征变化分解为可解释的几何组件,并揭示模型如何路由任务相关结构以产生提示驱动的行为。
