论文

KANSteer:文本到图像模型的非线性激活操控

Beyond the Linear Representation Hypothesis: Non-Linear Activation Steering in Text-to-Image Models

模型评测模型行为与机制分析

摘要

机械可解释性通常依赖于线性表示假设(LRH),该假设假设高级概念被编码为激活空间中的线性方向。然而,自然的视觉概念并不一定需要线性的视觉过渡:在晴朗和暴风雨之间存在着中间的天气状态,例如天空中有几朵白云,而不仅仅是一场较弱的风暴;在毛毛虫和蝴蝶之间,进步并不是毛毛虫翅膀不断生长。这就提出了这样的问题:这种真实的中间状态是否也由模型非线性表示。事实上,当我们直接提示文本到图像模型的中间属性时,它们的激活很少沿着连接端点的直线方向下降。因此,我们提出了 KANSteer,它将概念遍历建模为穿过其中间状态的曲线。为了寻求一种既简单又可解释的表示,我们建议使用柯尔莫哥洛夫-阿诺德网络(KAN),它提供一个一维坐标,其学习函数定义轨迹。这允许转向方向沿着概念变化,同时保留可解释的表示。在几个概念和文本到图像的扩散变换器中,我们发现它们的激活轨迹大大偏离直线,并且 KANSteer 比线性转向提供了更紧密的拟合和更平滑的中间属性遍历。

KANSteer:文本到图像模型的非线性激活操控:论文原图
图 1:许多概念在激活空间中并不是线性变化的。左:三个概念的块 $q$ 增量激活的 PCA 投影(更多内容请参见附录 7);每个点都是一个种子,具有属性质心和两个端点。中间属性偏离端点之间的直线,因此固定方向无法穿过这些属性。右图:扫掠封闭式线性方向(Linear Steering)保留源属性,然后跳转到目标,而其所拟合的提示生成属性(Prompt generated)则平滑地遍历概念。